2026年7月9日 · 星期四 · 第 2 期

Grok 4.5 复测出炉:两份榜单"打架"

覆盖过去24小时 X 平台热议与主流媒体报道 · 每日更新

今日头条

热度最高媒体报道

Grok 4.5 独立评测落地:Snorkel 判其第一,Artificial Analysis 只给第四

发布仅一天,Grok 4.5 的首批独立评测于7月9日前后陆续出炉,结论却截然相反:Snorkel 的 GDPval+ 职业工作任务评测中,Grok 4.5 以 29% 通过率居首,超过 GPT-5.5(22%)与 Opus 4.8(21%),法律(40%)、教育(58%)、医疗(35%)等专业判断类任务优势明显;而 Artificial Analysis 智能指数只给出 54 分、总榜第四,落后 Fable 5(60)、Opus 4.8(56)与 GPT-5.5(55)。细分项同样分裂:Grok 4.5 在 DeepSWE 1.0、Terminal Bench 2.1 上领先 Opus 4.8,却在 DeepSWE 1.1 与 SWE Bench Pro 上被反超。

为什么重要:这是对 Musk"Opus 级"宣称的第一轮第三方检验,结果是"看你用哪把尺子"。两大权威评测方向相反,直接动摇了 benchmark 作为采购依据的公信力——企业买家第一次被迫在"职业任务实测"与"综合智能指数"之间选边。影响谁:正在评估换模型的企业团队、以 benchmark 做营销的各家厂商,以及靠评测流量吃饭的榜单机构本身。后续看点:LMArena 等更多复测数据、xAI 是否公布完整官方对比、以及 $2/$6 定价下"每美元智能"叙事能否盖过榜位之争。

X 热议榜

争论中

1 · "Benchmark 已死":两份评测打架引爆信任危机

Snorkel 第一 vs Artificial Analysis 第四,同一个模型两种结论让 X 上的 benchmark 党彻底分裂。一派认为职业任务实测(GDPval+)才反映真实价值,综合指数已被"应试训练"污染;另一派反驳小样本职业评测方差太大、Snorkel 与厂商关系存疑。高赞总结:"2026年的 benchmark 之争,本质是谁有权定义'聪明'。"

来源:Snorkel AI · Kingy.ai
趋势卡

2 · "每美元智能"成为新叙事主线

开发者圈热议 Grok 4.5 的真正杀招不是榜位而是性价比:$2/$6 定价加上实测约 4.2 倍的 token 效率,被评为"今年最强的 intelligence-per-dollar 发布"。有人指出这套打法与中国厂商如出一辙——"性能够得着,就把战场拖到价格";反方则警告低价换量会烧穿 xAI 的算力账本。

隐私争议

3 · Fable 5 实名验证反弹进入第二天

Fable 5 按量计费叠加"政府证件+活体自拍"验证的余波未平:反对者晒出退订截图、呼吁抵制生物识别门槛;支持者认为最强模型配最严管控合理,且引用出口管制解除的背景为 Anthropic 辩护。"付费买模型还要交脸"仍是当日高频吐槽。

数据热帖

4 · "开源没伤到 Anthropic"?OpenRouter 数据引战

TechCrunch 分析称尽管中国开源模型拿走 30–46% 的企业 token 量,Anthropic 仍占 OpenRouter 平台一半以上的实际支出——"量在东移、钱还在西边"。乐观派据此认为高端市场护城河稳固,悲观派反问:当"够用"模型再降一档价格,支出还守得住吗?

来源:TechCrunch

大模型与前沿技术

商业与投资

政策与治理

产品与应用

深度视角

当榜单开始打架:评测公信力的黄昏与采购逻辑的重构

Grok 4.5 发布24小时内发生的事,比发布本身更值得记录:两家最常被引用的独立评测机构给出了方向相反的结论。Snorkel 的职业任务评测把它推上第一,Artificial Analysis 的综合指数把它压到第四;同一对模型在 DeepSWE 1.0 和 1.1 两个版本上胜负互换。这不是某一方出错,而是评测体系性的裂缝——当前沿模型在综合能力上挤进6分区间(60/56/55/54),任何评测的构造选择(任务分布、打分方式、样本量)都足以颠倒排名。

这对行业的直接后果是:benchmark 正在失去"采购决策快捷方式"的功能。过去企业可以看一眼总榜再谈价格,现在榜单只能回答"在这套尺子下谁更强"。于是竞争叙事开始迁移——xAI 干脆不争榜首,用 $2/$6 定价和 token 效率把问题改写成"每美元智能";Anthropic 则押注高端:即便中国模型拿走近半 token 量,OpenRouter 上超过一半的真金白银仍流向 Claude 系。量与钱的分离,说明市场已经自发分层。

接下来值得盯住三件事:一是评测机构会不会走向"审计化"——公开方法论、利益披露、可复现实验,否则信任流失只会加速;二是8月1日联合国前沿模型认定框架落地后,合规评估是否会成为事实上的"官方 benchmark";三是价格战下沉的速度——当第四名只比第一名便宜75%却只差6分,高溢价路线的每一次续费都是一次投票。榜单的黄昏,未必是坏事:它逼着买家回到唯一可靠的评测——自己的工作负载。