AI模型排行

看复杂问题中的回答表现,帮助筛选值得进一步测试的模型。

官方前30数据至2026-09-02
Hard Prompts · 复杂问题盲测风格控制 · 不混合评分核验官方榜单
01claude-opus-4-6-highAnthropic15331529153745,743
claude-opus-4-6-high · 45,743区间:15291537;重叠时不能认定胜负。查看原始数据
02claude-fable-5Anthropic15331527153917,887
claude-fable-5 · 17,887区间:15271539;重叠时不能认定胜负。查看原始数据
03claude-opus-4-6Anthropic15271523153149,259
claude-opus-4-6 · 49,259区间:15231531;重叠时不能认定胜负。查看原始数据
04claude-opus-4-7-highAnthropic15261521153140,212
claude-opus-4-7-high · 40,212区间:15211531;重叠时不能认定胜负。查看原始数据
05claude-fable-5.1-maxAnthropic1522150715371,662
claude-fable-5.1-max · 1,662区间:15071537;重叠时不能认定胜负。查看原始数据
06claude-opus-4-7Anthropic15191514152440,918
claude-opus-4-7 · 40,918区间:15141524;重叠时不能认定胜负。查看原始数据
07kimi-k3-maxMoonshot15191513152511,751
kimi-k3-max · 11,751区间:15131525;重叠时不能认定胜负。查看原始数据
08claude-opus-5-highAnthropic15181513152323,221
claude-opus-5-high · 23,221区间:15131523;重叠时不能认定胜负。查看原始数据
09gemini-3.8-flash-highGoogle · 初步结果1518150815283,458
gemini-3.8-flash-high · 3,458区间:15081528;重叠时不能认定胜负。查看原始数据
10claude-opus-4-8-highAnthropic15151510152032,372
claude-opus-4-8-high · 32,372区间:15101520;重叠时不能认定胜负。查看原始数据
11claude-opus-5-maxAnthropic15141507152111,171
claude-opus-5-max · 11,171区间:15071521;重叠时不能认定胜负。查看原始数据
12muse-spark-1.2 (xHigh)Meta1513150015262,124
muse-spark-1.2 (xHigh) · 2,124区间:15001526;重叠时不能认定胜负。查看原始数据
13muse-spark-1.1Meta15111505151716,123
muse-spark-1.1 · 16,123区间:15051517;重叠时不能认定胜负。查看原始数据
14gemini-3.7-flash-highGoogle · 初步结果1508149815183,816
gemini-3.7-flash-high · 3,816区间:14981518;重叠时不能认定胜负。查看原始数据
15glm-5.3-maxZ.ai1507149815165,079
glm-5.3-max · 5,079区间:14981516;重叠时不能认定胜负。查看原始数据
16gemini-3.1-pro-previewGoogle15071503151166,745
gemini-3.1-pro-preview · 66,745区间:15031511;重叠时不能认定胜负。查看原始数据
17gpt-5.6-sol-xhighOpenAI15071501151315,374
gpt-5.6-sol-xhigh · 15,374区间:15011513;重叠时不能认定胜负。查看原始数据
18muse-sparkMeta1505149815128,737
muse-spark · 8,737区间:14981512;重叠时不能认定胜负。查看原始数据
19claude-sonnet-4-6Anthropic15041500150843,063
claude-sonnet-4-6 · 43,063区间:15001508;重叠时不能认定胜负。查看原始数据
20gemini-3-proGoogle15041499150922,292
gemini-3-pro · 22,292区间:14991509;重叠时不能认定胜负。查看原始数据
21claude-opus-4-8Anthropic15031498150832,874
claude-opus-4-8 · 32,874区间:14981508;重叠时不能认定胜负。查看原始数据
22qwen3.8-maxAlibaba1502149515099,005
qwen3.8-max · 9,005区间:14951509;重叠时不能认定胜负。查看原始数据
23gpt-5.5-highOpenAI15021497150741,634
gpt-5.5-high · 41,634区间:14971507;重叠时不能认定胜负。查看原始数据
24gemini-3.6-flash-highGoogle15001494150615,046
gemini-3.6-flash-high · 15,046区间:14941506;重叠时不能认定胜负。查看原始数据
25claude-opus-4-5-20251101-high-32kAnthropic14991494150419,573
claude-opus-4-5-20251101-high-32k · 19,573区间:14941504;重叠时不能认定胜负。查看原始数据
26gpt-5.5OpenAI14981493150343,203
gpt-5.5 · 43,203区间:14931503;重叠时不能认定胜负。查看原始数据
27gpt-5.4-highOpenAI14981493150339,290
gpt-5.4-high · 39,290区间:14931503;重叠时不能认定胜负。查看原始数据
28claude-opus-4-5-20251101Anthropic14981494150241,298
claude-opus-4-5-20251101 · 41,298区间:14941502;重叠时不能认定胜负。查看原始数据
29gemini-3.5-flash-highGoogle14971492150222,905
gemini-3.5-flash-high · 22,905区间:14921502;重叠时不能认定胜负。查看原始数据
30gpt-5.2-chat-latest-20260210OpenAI14971492150221,618
gpt-5.2-chat-latest-20260210 · 21,618区间:14921502;重叠时不能认定胜负。查看原始数据

数据来源

数据来自Arena Text Leaderboard本地归档官方2026-09-02页面前30名;分数和区间按页面显示精度保存,区间端点由页面的四舍五入分数与误差范围换算,不冒充精确统计值。 两个榜单分别保留其数据日期,Scope.AI不混合分数、不改写官方排名。

阅读Arena排名方法