2026年7月17日 · 星期五 · 第 7 期(更新版)

2.8万亿参数的开源核弹:Kimi K3 杀入全球前三

覆盖过去24小时 X 平台热议与主流媒体报道 · 每日更新

今日头条

热度最高官方发布

月之暗面发布 Kimi K3:史上最大开源模型,评测榜上仅次于 Fable 5 与 GPT-5.6

月之暗面(Moonshot AI)正式发布 Kimi K3——2.8万亿参数的 MoE 架构、1M token 上下文、原生支持文本/图像/视频输入,将成为有史以来最大的开源权重模型(承诺7月27日前放出权重)。架构上引入自研的 Kimi Delta Attention(混合线性注意力)与 Attention Residuals。性能是真正的爆点:在覆盖44个职业、9大行业真实任务的 GDPval-AA v2 上得分1687,全球第三,仅次于 Claude Fable 5 Max(1815)和 GPT-5.6 Sol Max(1747.8),压过 Claude Opus 4.8(1600);在长程知识工作评测 AA-Briefcase 上以1527分排名第二,反超 Sol Max;在8项真实任务自动化评测中拿下4项第一,包括 Automation Bench、SpreadsheetBench 2 和 BrowseComp。API 定价:输入 $3/百万token(缓存命中 $0.30)、输出 $15。

为什么重要:这是开源模型第一次在权威agentic评测上稳定挤进全球前三——"开源落后闭源一年"的行业共识被压缩到了几个月甚至几周。而且它赢在最值钱的地方:不是聊天,而是长程自主任务,即当下所有实验室公认的下一个战场。影响谁:按 Fable 5 与 GPT-5.6 溢价定价的闭源实验室(K3 被概括为"Fable级性能、Sonnet级定价")、可以在7月27日后自托管frontier模型的企业、以及本已白热化的每任务成本价格战。后续看点:7月27日开源权重是否如期兑现及许可条款、第三方复测能否坐实自报成绩、Fable 5 与 GPT-5.6 是否被迫降价回应。

X 热议榜

刷屏中

1 · "Fable级性能、Sonnet级定价":K3 一句话总结帖病毒式传播

开发者 Aman 的总结帖成为 K3 发布日最出圈的一条:"2.8T MoE、1M上下文、原生多模态、长程agentic编码、Fable级性能Sonnet级定价——这可能是很久以来最大的开源发布。"乐观派宣布"开源与闭源的差距刚刚消失";冷静派连发提醒:所有成绩均为官方自报,1M上下文的真实召回、以及2.8T参数的推理成本(自托管需要多少张卡)才是接下来两周的真问题。

来源:Aman @ X · Glitchwire
独立实测

2 · Simon Willison 的"鹈鹕骑车"评测:K3 通过了最不正经也最难糊弄的基准

独立开发者 Simon Willison 第一时间用他标志性的"让模型画一只骑自行车的鹈鹕SVG"非正式基准实测 K3,并撰文讨论自报benchmark之外我们还能从这类"野路子评测"里学到什么。技术圈的共识正在形成:官方跑分看位次,民间怪题看泛化——K3 在两边的初步表现都超出了对开源模型的预期。

全网蹲守

3 · Gemini 3.5 Pro"交卷日":官方文档至今空白

传闻中的7月17日就是今天,但截至发稿 Google API 文档仍无模型卡、无定价页,所有规格(2M上下文、Deep Think、约$1.25/$10)仍出自匿名信源。X 上的直播蹲守帖已经盖了几千层:"第三次跳票就写进历史。"K3 的横空出世让等待更煎熬——现在 Google 要对撞的不只是 GPT-5.6,还有一个即将开源的2.8T对手。

来源:TechTimes · LLM Stats
账单党狂欢

4 · Anthropic 五周内第三次延长 Fable 5 免费:价格战进入"晒账单"阶段

Anthropic 将 Fable 5 免费访问期再次延长至7月19日,被普遍解读为对 GPT-5.6 Sol 低价攻势的直接回应。X 上的硬通货是账单截图:同一批任务在 Sol 上花 $16、在 Fable 5 上花 $63;聚合统计显示 Grok 4.5 每个 agentic 任务成本约 $2.49,Fable 5 约 $11.80。K3 携 Sonnet 级定价入局后,"性能溢价还能收多久"的争论火上浇油。

来源:LLM Stats
社区传闻

5 · "Claude Honeycomb EAP" 现身 Cursor:Opus 5 要来了?

眼尖的用户在 Cursor 模型列表里发现名为 "Claude Honeycomb EAP" 的神秘条目,主流猜测是 Opus 5 的早期访问版本,也有人认为只是 Fable 5 的编码特化分支。Anthropic 照例不予置评。在 K3 发布、TechCrunch 直言"K3 预计追平 Opus 4.8"的今天,这个传闻多了一层紧迫感:闭源阵营的下一张牌不能太远。

来源:LLM Stats · TechCrunch

大模型与前沿技术

商业与投资

政策与治理

产品与应用

深度视角

当"第三名"是开源的:K3 之后,闭源溢价还剩下什么

Kimi K3 最扎眼的不是2.8万亿参数,而是它在成绩单上的位置:GDPval-AA v2 全球第三,只输 Fable 5 Max 和 GPT-5.6 Sol Max,赢了 Opus 4.8;AA-Briefcase 第二;8项真实任务自动化评测拿下一半的第一。过去开源模型的角色是"闭源的平价替代",K3 第一次把开源放进了"frontier正面竞争者"的格子里——而且十天后任何人都可以把它下载回家。

这改变了三笔账。第一笔是价格账:K3 的 $3/$15 定价卡在 Sonnet 区间,却对标 Opus 以上的性能;当"性能第三"只收"性能第七"的钱,Fable 5 与 GPT-5.6 的溢价必须靠可靠性、生态与合规来辩护,而不能只靠榜单位次。第二笔是部署账:7月27日权重开放后,受数据主权约束的银行、政府与医疗客户第一次有了"自托管frontier"选项——尽管2.8T参数的推理集群门槛会把这个选项限制在大玩家手里,但"能不能"与"贵不贵"是两个性质的问题。第三笔是地缘账:中国开源模型已占美国企业30-46%的token消耗量,K3 在 WAIC 开幕当天登顶开源榜,技术渗透与治理叙事在同一周相互加持。

当然,所有成绩目前都是自报的。扩散在X上的怀疑并非抬杠:1M上下文的真实召回率、长任务的失败模式、以及第三方复测后的排名,都可能在两周内改写今天的结论。值得跟踪的信号:7月27日的开源许可条款(商用限制会直接决定冲击力)、Artificial Analysis 等第三方的独立复测、以及 Fable 5 免费期7月19日到期时 Anthropic 的定价动作——那将是闭源阵营对 K3 的第一个真实回应。