2026年7月9日 · 星期四 · 第 2 期
Grok 4.5 复测出炉:两份榜单"打架"
覆盖过去24小时 X 平台热议与主流媒体报道 · 每日更新
今日头条
热度最高媒体报道
Grok 4.5 独立评测落地:Snorkel 判其第一,Artificial Analysis 只给第四
发布仅一天,Grok 4.5 的首批独立评测于7月9日前后陆续出炉,结论却截然相反:Snorkel 的 GDPval+ 职业工作任务评测中,Grok 4.5 以 29% 通过率居首,超过 GPT-5.5(22%)与 Opus 4.8(21%),法律(40%)、教育(58%)、医疗(35%)等专业判断类任务优势明显;而 Artificial Analysis 智能指数只给出 54 分、总榜第四,落后 Fable 5(60)、Opus 4.8(56)与 GPT-5.5(55)。细分项同样分裂:Grok 4.5 在 DeepSWE 1.0、Terminal Bench 2.1 上领先 Opus 4.8,却在 DeepSWE 1.1 与 SWE Bench Pro 上被反超。
为什么重要:这是对 Musk"Opus 级"宣称的第一轮第三方检验,结果是"看你用哪把尺子"。两大权威评测方向相反,直接动摇了 benchmark 作为采购依据的公信力——企业买家第一次被迫在"职业任务实测"与"综合智能指数"之间选边。影响谁:正在评估换模型的企业团队、以 benchmark 做营销的各家厂商,以及靠评测流量吃饭的榜单机构本身。后续看点:LMArena 等更多复测数据、xAI 是否公布完整官方对比、以及 $2/$6 定价下"每美元智能"叙事能否盖过榜位之争。
X 热议榜
争论中
1 · "Benchmark 已死":两份评测打架引爆信任危机
Snorkel 第一 vs Artificial Analysis 第四,同一个模型两种结论让 X 上的 benchmark 党彻底分裂。一派认为职业任务实测(GDPval+)才反映真实价值,综合指数已被"应试训练"污染;另一派反驳小样本职业评测方差太大、Snorkel 与厂商关系存疑。高赞总结:"2026年的 benchmark 之争,本质是谁有权定义'聪明'。"
趋势卡
2 · "每美元智能"成为新叙事主线
开发者圈热议 Grok 4.5 的真正杀招不是榜位而是性价比:$2/$6 定价加上实测约 4.2 倍的 token 效率,被评为"今年最强的 intelligence-per-dollar 发布"。有人指出这套打法与中国厂商如出一辙——"性能够得着,就把战场拖到价格";反方则警告低价换量会烧穿 xAI 的算力账本。
隐私争议
3 · Fable 5 实名验证反弹进入第二天
Fable 5 按量计费叠加"政府证件+活体自拍"验证的余波未平:反对者晒出退订截图、呼吁抵制生物识别门槛;支持者认为最强模型配最严管控合理,且引用出口管制解除的背景为 Anthropic 辩护。"付费买模型还要交脸"仍是当日高频吐槽。
数据热帖
4 · "开源没伤到 Anthropic"?OpenRouter 数据引战
TechCrunch 分析称尽管中国开源模型拿走 30–46% 的企业 token 量,Anthropic 仍占 OpenRouter 平台一半以上的实际支出——"量在东移、钱还在西边"。乐观派据此认为高端市场护城河稳固,悲观派反问:当"够用"模型再降一档价格,支出还守得住吗?
大模型与前沿技术
- 媒体报道Grok 4.5 登顶 SWE Marathon — 长时程编程任务基准第一,编程模型之战再添变量。Crypto Briefing
- 媒体报道Artificial Analysis 智能指数更新 — Fable 5(60)居首,Opus 4.8(56)、GPT-5.5(55)、Grok 4.5(54)紧随其后,前四差距缩至6分。Artificial Analysis
- 官方发布GPT-5.6 面向全球开放 — 美国政府"逐客户审批"限制结束,OpenAI 宣布全球发布。CNBC
- 媒体报道Snorkel GDPval+ 专业任务评测 — Grok 4.5 在法律、教育、医疗等高判断力场景领先,专业垂直能力成为新竞争维度。Snorkel AI
商业与投资
- 媒体报道8090 Labs 完成 $1.35亿 A轮 — Salesforce Ventures 领投,"Software Factory" agentic 编程平台主攻医疗、航天等强监管行业。Crescendo VC
- 媒体报道Crunchbase 本周十大融资:AI 与能源领跑 — Q3 首周榜单出炉,AI、能源、生物科技包揽头部,Joulent 居首。Crunchbase News
- 媒体报道Q3 首周 AI agent 赛道遇冷 — 仅3笔公开融资、合计约 $3700万,与上半年热度形成反差。Gravity 融资追踪
- 媒体报道Reflection AI 启用 $63亿 算力租约 — 锁定 SpaceX Colossus 2 的 GB300 芯片至2029年,训练美国开源前沿模型。Crescendo
政策与治理
- 官方发布联合国 AI 治理全球对话闭幕 — 日内瓦会议聚焦"灾难性危害"预警,Bengio 称 AI 发展"已超出科学理解与政府适应能力";8月1日"受管辖前沿模型"认定框架将触发。UN News
- 官方发布欧盟"网络安全+AI"行动计划推进 — 协调成员国应对先进模型的安全挑战,欧盟级模型评估能力预计2027年运行。EU Digital Strategy
- 官方发布AI Act 透明度规则下月生效 — 2026年8月起适用,高风险系统合规期限此前已延至2027/2028。EU Digital Strategy
- 媒体报道美国对前沿模型的出口管控松动 — 继 Fable/Mythos 解禁后,GPT-5.6 的"逐客户审批"也告终结,管控周期约三周。CNBC
产品与应用
- 官方发布Cursor 正式上线 Grok 4.5 — 联合训练的编程能力首发落地,开发者可在编辑器内直接调用。Cursor 官方
- 媒体报道X 应用内 Grok 图像改图引发混乱 — 用户可对他人帖子图片直接 AI 改图,滥改与恶搞泛滥,内容边界争议再起。Capture Magazine
- 媒体报道GPT-Live 语音持续铺开 — 全双工语音模型推送范围扩大,"会附和、会等你想完"的体验帖仍在刷屏。OpenAI
深度视角
当榜单开始打架:评测公信力的黄昏与采购逻辑的重构
Grok 4.5 发布24小时内发生的事,比发布本身更值得记录:两家最常被引用的独立评测机构给出了方向相反的结论。Snorkel 的职业任务评测把它推上第一,Artificial Analysis 的综合指数把它压到第四;同一对模型在 DeepSWE 1.0 和 1.1 两个版本上胜负互换。这不是某一方出错,而是评测体系性的裂缝——当前沿模型在综合能力上挤进6分区间(60/56/55/54),任何评测的构造选择(任务分布、打分方式、样本量)都足以颠倒排名。
这对行业的直接后果是:benchmark 正在失去"采购决策快捷方式"的功能。过去企业可以看一眼总榜再谈价格,现在榜单只能回答"在这套尺子下谁更强"。于是竞争叙事开始迁移——xAI 干脆不争榜首,用 $2/$6 定价和 token 效率把问题改写成"每美元智能";Anthropic 则押注高端:即便中国模型拿走近半 token 量,OpenRouter 上超过一半的真金白银仍流向 Claude 系。量与钱的分离,说明市场已经自发分层。
接下来值得盯住三件事:一是评测机构会不会走向"审计化"——公开方法论、利益披露、可复现实验,否则信任流失只会加速;二是8月1日联合国前沿模型认定框架落地后,合规评估是否会成为事实上的"官方 benchmark";三是价格战下沉的速度——当第四名只比第一名便宜75%却只差6分,高溢价路线的每一次续费都是一次投票。榜单的黄昏,未必是坏事:它逼着买家回到唯一可靠的评测——自己的工作负载。