跳到正文

Arena Text Style-Controlled

LMArena · 真人匿名两两比较回答,看大家更愿意读哪一个。补上选择题看不出的整体体验。

官方评测
在 MyHOT 中交叉参考
证据预算不参与排序
上游数据时间10/02 08:00
最近成功同步10/03 20:05

它测什么,怎么测

只取官方发布快照中的 Text Overall style-controlled 主榜,不抓取 arena.ai 实时页面。

如何使用这份证据

整体文本榜仅交叉参考;创作分类已单独使用,不再叠加整体票。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1gemini-4-argon-highGoogle1,525.2High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
2claude-opus-4-6-highAnthropic1,504.7High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
3claude-fable-5-highAnthropic1,504.3High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
4claude-opus-5.5-highAnthropic1,503.7High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
5claude-opus-4-7-highAnthropic1,501.3High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
6claude-fable-5.1-maxAnthropic1,501.1Max 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
8gemini-3.8-flash-highGoogle1,494.8High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
9muse-spark-1.3-maxMeta1,494.3Max 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
11muse-spark-1.2 (xHigh)Meta1,493.5xHigh 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
12muse-spark-1.1Meta1,491.3来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
14claude-opus-5-maxAnthropic1,489.5Max 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
15muse-sparkMeta1,489.3来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
16kimi-k3-maxMoonshot AI1,488.4来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
17gemini-3.7-flash-highGoogle1,487.7High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
18gemini-3.1-pro-previewGoogle1,487来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
19gemini-3-proGoogle1,485.5来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
20gpt-5.6-sol-xhighOpenAI1,483.9xHigh 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
21gpt-6.1-sol-maxOpenAI1,483.2Max 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
22gemini-3.6-flash-highGoogle1,483High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
23qwen3.8-maxAlibaba1,481.6来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
24claude-opus-4-8-highAnthropic1,481.5High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
25gpt-5.5-highOpenAI1,481.4High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
26mimo-v2.6-proXiaomi1,480.1来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
27glm-5.3-maxZ.ai1,478.5来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
28gemini-3.5-flash-highGoogle1,477.4High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
29gpt-6-astra-maxOpenAI1,477.1Max 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
32glm-5.2-maxZ.ai1,475.8来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
33gpt-5.2-chat-latest-20260210OpenAI1,475.7来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
34gpt-5.4-highOpenAI1,475.2High 推理未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
35qwen3.7-max-previewAlibaba1,474.9来源默认配置未计入:整体文本偏好是复合结果,仅供交叉核对,不与细分结果重复计分。
评测局限与数据署名

人类偏好受风格、用户结构和提示分布影响;整体与分类存在重叠。

数据许可:CC BY 4.0

成绩由 LMArena 发布,各项原始分数使用不同尺度,不能直接相加;参考位次采用公开的分差标准化规则。