Arena平台于2026年7月20日发布了最新一期(统计周期:7月13日-19日)大模型排行榜。本周榜单迎来大规模新模型集中入榜,其中国产模型表现亮眼:Kimi K3不仅首次跻身综合榜前十,更直接登顶前端开发榜榜首,在细分能力上实现了对多数海外头部模型的反超,标志着国产大模型在特定工程场景已形成领先优势。
综合榜:Claude Fable 5蝉联,Kimi K3跻身第一梯队边缘
综合榜头部竞争激烈,第一名由 claude-fable-5 以1507分的ELO分数占据,Anthropic旗下多款思考版本模型(如 claude-opus-4-7-thinking 等)集中占据了Top 5的席位,彼此分差在15分以内,属于并列第一梯队。
本周最大亮点是国产模型Kimi K3以1486分的ELO分数排名第9位,首次闯入综合榜Top 10。其分数与第8名的 gemini-3-pro、第10名的 gpt-5.6-sol-xhigh 完全一致,表明其已稳居全球第一梯队的边缘位置。
代码榜:Anthropic模型包揽前列,Kimi K3挺进前十
代码榜榜首发生变动,claude-opus-4-7-thinking 以1553分升至第一,将此前居首的 claude-fable-5 挤至第二(1551分),两者仅差2分,属于并列第一梯队。Anthropic的思考模型几乎包揽了前7名,统治力依然强劲。
国产模型Kimi K3同样首次进入代码榜Top 10,排名第10位,ELO 1529分,与第9名模型仅差1分,表现已十分接近第一梯队。
前端开发榜:Kimi K3强势登顶,国产能力领跑全球
前端开发榜呈现出前所未有的格局。Kimi K3以1679分的高分直接位居第一名,大幅领先第二名 claude-fable-5 的1631分,分差达48分,优势明显。其在前端领域的实力不仅体现在总分上,更在品牌与营销、基于参考的设计、数据与分析、消费产品、模拟、内容创建工具6个细分领域均排名第一,仅在游戏领域位列第二。
第四名同样由国产模型 glm-5.2 (max) 以1587分拿下,超越了多款Claude、OpenAI的旗舰模型。这意味着,国产大模型在前端开发这一细分场景的能力已经走在了全球最前列。
智能体榜:Claude Fable 5(High)居首,国产模型GLM 5.2(Max)入局前十
智能体榜本周全部是新入榜模型。第一名是 Claude Fable 5 (High),净提升度13.94%,并拥有30.65%的最高好评/差评比,工具幻觉率仅1.33%。第二名 GPT 5.6 Sol (xHigh) 的可控性数值最高,达到17.26%。
国产模型 GLM 5.2 (Max) 也杀入榜单Top 10,位列第9,净提升度为6.24%。其Bash恢复速度仅4.45,远好于头部平均水平,在命令出错后能快速恢复,表现突出。
AI生图与视频榜:格局稳定,国产模型占据重要席位
AI生图榜格局稳定,OpenAI的 gpt-image-2 (medium) 以1385分稳居第一。字节跳动的 seedream-5.0-pro 作为最高排名的国产模型位列第11位(ELO 1231分),紧随多款海外头部生图模型之后。
AI视频榜方面,谷歌 gemini-omni-flash 位列榜首。字节跳动的 dreamina-seedance-2.0-720p 稳居第二名,ELO分数1482分,表现远超多数海外视频生成模型。同时阿里的 happyhorse-1.0 也拿下第4位,国产力量在AI视频生成第一梯队已占据重要席位。
总结:国产大模型实现关键性跨越,从追赶走向定义前沿
本周Arena榜单的核心看点是国产模型的多点突破。Kimi K3在综合榜、代码榜、前端开发榜的集体表现,特别是前端开发榜的登顶,证明国产大模型不仅在通用能力上追平了国际第一梯队,在特定工程类任务场景已经形成了明确的领先优势。同时,字节跳动、阿里巴巴、智谱AI等厂商的多款模型也在代码、生图、视频、智能体等多个榜单的前半区站稳脚跟,梯队完整度进一步提升。
随着用户评测数据的积累,下周部分新入榜模型的排名和分数可能出现小幅变动,后续能否有更多国产模型在细分榜单拿下榜首,值得持续关注。