AI 在簿记速度与准确率上超越执业会计师,但仍无法脱离监督独立结账
Mercor 的 APEX 财会基准测试显示,AI 模型在结构化簿记任务的速度、准确率和成本上均已超越执业会计师,但在复杂场景中仍无法脱离监督独立结账。
Mercor 的 APEX 财会基准测试显示,AI 模型在结构化簿记任务的速度、准确率和成本上均已超越执业会计师,但在复杂场景中仍无法脱离监督独立结账。
Hugging Face 推出 Open TTS Leaderboard,采用客观自动化指标对开源文本转语音(TTS)模型进行多语言性能、推理延迟与声音克隆维度的评测。
推荐理由:榜单通过自动化客观指标替代耗时的人工盲测投票,为多语言与声音克隆模型的选型提供了可量化的参考。
英国人工智能安全研究所(UK AISI)采用 EvalEval 基础设施公开评测结果与运行配置,推进基准测试的可复现性。该合作在 Evaluation Cards 上公开了覆盖 Claude Opus 4/4.5/4.6 与 GPT-5/5.2/5.4 等模型的评测数据,涉及 FrontierMath 和 SWE-Bench Pro 等五项基准。