AI 在簿记速度与准确率上超越执业会计师,但仍无法脱离监督独立结账
Mercor 的 APEX 财会基准测试显示,AI 模型在结构化簿记任务的速度、准确率和成本上均已超越执业会计师,但在复杂场景中仍无法脱离监督独立结账。
Mercor 的 APEX 财会基准测试显示,AI 模型在结构化簿记任务的速度、准确率和成本上均已超越执业会计师,但在复杂场景中仍无法脱离监督独立结账。
OpenAI 推出的 Dots 智能体平台率先向每月 100 美元的最高档账户开放,主打通过云端虚拟机和桌面权限操作各类软件以协同办公。实测显示,Dot 在处理订购服务、网站预约等个人生活任务时频繁受阻于人机安全验证,缺少无缝支付集成;但在获得电脑权限后,能够高效完成剪辑视频片段和迭代重构个人网站等实际工作。
Hugging Face 推出 Open TTS Leaderboard,采用客观自动化指标对开源文本转语音(TTS)模型进行多语言性能、推理延迟与声音克隆维度的评测。
推荐理由:榜单通过自动化客观指标替代耗时的人工盲测投票,为多语言与声音克隆模型的选型提供了可量化的参考。
Basis 使用 GPT-6 Astra 完成一个包含 50 个工作表的税务工作簿,处理速度达到 GPT-5.6 Sol 的 2 倍。此外,该模型具备更强的用户意图理解能力,让 Basis 在实际业务应用中更具信心。
英国人工智能安全研究所(UK AISI)采用 EvalEval 基础设施公开评测结果与运行配置,推进基准测试的可复现性。该合作在 Evaluation Cards 上公开了覆盖 Claude Opus 4/4.5/4.6 与 GPT-5/5.2/5.4 等模型的评测数据,涉及 FrontierMath 和 SWE-Bench Pro 等五项基准。
NVIDIA 在 MLPerf Inference v6.1 评测中首次展示 Vera Rubin NVL72 系统性能,在 Qwen3-VL 基准测试中吞吐量最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高提升 2.5 倍。