2026年7月17日 · 星期五 · 第 7 期(更新版)
2.8万亿参数的开源核弹:Kimi K3 杀入全球前三
覆盖过去24小时 X 平台热议与主流媒体报道 · 每日更新
今日头条
热度最高官方发布
月之暗面发布 Kimi K3:史上最大开源模型,评测榜上仅次于 Fable 5 与 GPT-5.6
月之暗面(Moonshot AI)正式发布 Kimi K3——2.8万亿参数的 MoE 架构、1M token 上下文、原生支持文本/图像/视频输入,将成为有史以来最大的开源权重模型(承诺7月27日前放出权重)。架构上引入自研的 Kimi Delta Attention(混合线性注意力)与 Attention Residuals。性能是真正的爆点:在覆盖44个职业、9大行业真实任务的 GDPval-AA v2 上得分1687,全球第三,仅次于 Claude Fable 5 Max(1815)和 GPT-5.6 Sol Max(1747.8),压过 Claude Opus 4.8(1600);在长程知识工作评测 AA-Briefcase 上以1527分排名第二,反超 Sol Max;在8项真实任务自动化评测中拿下4项第一,包括 Automation Bench、SpreadsheetBench 2 和 BrowseComp。API 定价:输入 $3/百万token(缓存命中 $0.30)、输出 $15。
为什么重要:这是开源模型第一次在权威agentic评测上稳定挤进全球前三——"开源落后闭源一年"的行业共识被压缩到了几个月甚至几周。而且它赢在最值钱的地方:不是聊天,而是长程自主任务,即当下所有实验室公认的下一个战场。影响谁:按 Fable 5 与 GPT-5.6 溢价定价的闭源实验室(K3 被概括为"Fable级性能、Sonnet级定价")、可以在7月27日后自托管frontier模型的企业、以及本已白热化的每任务成本价格战。后续看点:7月27日开源权重是否如期兑现及许可条款、第三方复测能否坐实自报成绩、Fable 5 与 GPT-5.6 是否被迫降价回应。
X 热议榜
刷屏中
1 · "Fable级性能、Sonnet级定价":K3 一句话总结帖病毒式传播
开发者 Aman 的总结帖成为 K3 发布日最出圈的一条:"2.8T MoE、1M上下文、原生多模态、长程agentic编码、Fable级性能Sonnet级定价——这可能是很久以来最大的开源发布。"乐观派宣布"开源与闭源的差距刚刚消失";冷静派连发提醒:所有成绩均为官方自报,1M上下文的真实召回、以及2.8T参数的推理成本(自托管需要多少张卡)才是接下来两周的真问题。
独立实测
2 · Simon Willison 的"鹈鹕骑车"评测:K3 通过了最不正经也最难糊弄的基准
独立开发者 Simon Willison 第一时间用他标志性的"让模型画一只骑自行车的鹈鹕SVG"非正式基准实测 K3,并撰文讨论自报benchmark之外我们还能从这类"野路子评测"里学到什么。技术圈的共识正在形成:官方跑分看位次,民间怪题看泛化——K3 在两边的初步表现都超出了对开源模型的预期。
全网蹲守
3 · Gemini 3.5 Pro"交卷日":官方文档至今空白
传闻中的7月17日就是今天,但截至发稿 Google API 文档仍无模型卡、无定价页,所有规格(2M上下文、Deep Think、约$1.25/$10)仍出自匿名信源。X 上的直播蹲守帖已经盖了几千层:"第三次跳票就写进历史。"K3 的横空出世让等待更煎熬——现在 Google 要对撞的不只是 GPT-5.6,还有一个即将开源的2.8T对手。
账单党狂欢
4 · Anthropic 五周内第三次延长 Fable 5 免费:价格战进入"晒账单"阶段
Anthropic 将 Fable 5 免费访问期再次延长至7月19日,被普遍解读为对 GPT-5.6 Sol 低价攻势的直接回应。X 上的硬通货是账单截图:同一批任务在 Sol 上花 $16、在 Fable 5 上花 $63;聚合统计显示 Grok 4.5 每个 agentic 任务成本约 $2.49,Fable 5 约 $11.80。K3 携 Sonnet 级定价入局后,"性能溢价还能收多久"的争论火上浇油。
社区传闻
5 · "Claude Honeycomb EAP" 现身 Cursor:Opus 5 要来了?
眼尖的用户在 Cursor 模型列表里发现名为 "Claude Honeycomb EAP" 的神秘条目,主流猜测是 Opus 5 的早期访问版本,也有人认为只是 Fable 5 的编码特化分支。Anthropic 照例不予置评。在 K3 发布、TechCrunch 直言"K3 预计追平 Opus 4.8"的今天,这个传闻多了一层紧迫感:闭源阵营的下一张牌不能太远。
大模型与前沿技术
- 官方发布Kimi K3 架构细节公开 — Kimi Delta Attention 混合线性注意力+Attention Residuals,2.8T 总参数的 MoE 设计将激活参数控制在可服务范围,1M 上下文原生多模态;权重承诺7月27日前开源。MarkTechPost
- 官方发布NVIDIA 开源扩散语言模型 TwoTower — 不逐token生成、并行"去噪"整段文本:吞吐量2.42倍、保留98.7%基线质量;技术圈热议这是否是自回归架构统治的第一道裂缝。LLM Stats
- 社区传闻Gemini 3.5 Pro 重建始末 — 报道称原基座在递归工具调用与SVG生成上存在结构性失败,DeepMind 推倒重训导致六周延期;今日能否交卷待验证。HackerNoon
- 媒体报道GitHub Copilot 接入首个开源权重编程模型 — 微软生态首次在自家编程助手里提供非专有模型选项;K3 开源后,"主流分发渠道跑开源模型"的名单预计还会加长。AIapps
商业与投资
- 媒体报道Crunchbase:上半年全球风投5100亿美元创历史纪录 — 已超过2025年全年的4400亿美元,AI 是绝对引擎;退出端 IPO 与并购同步井喷。Crunchbase News
- 媒体报道OpenAI 被曝筹备保密IPO申报:估值约7300亿美元 — 高盛与摩根士丹利牵头,最早9月递交;同时被报道向美国政府提供价值426亿美元的股份安排。LLM Stats
- 媒体报道印度AI编程公司 Emergent 融资1.3亿美元,估值15亿 — "vibe coding"赛道首个印度独角兽,讨论焦点在人才与算力的成本套利。MEAN Blog
- 媒体报道Anthropic 年化营收约470亿美元、据报2026年已盈利 — 由 Claude Code 与企业渗透驱动;与 Blackstone 等合资的15亿美元实施公司 Ode 押注"下一个万亿美元生意是落地,不是模型"。TechCrunch
政策与治理
- 官方发布WAIC 暨全球AI治理高级别会议今日上海开幕 — 140多场论坛、1100家展商、300余款产品全球首发;核心议程包括建立面向全球的"世界AI合作组织"(WAICO)提案,总部拟落沪。CGTN
- 官方发布中国智能体新规7月15日起施行 — 全球首个 AI agent 专门监管类别:三级决策授权框架,高风险行业强制备案;生效48小时后 WAIC 开幕,执行样本即将大规模出现。AI Governance Institute
- 媒体报道美国联邦前沿模型框架还剩15天 — 8月1日"受管辖前沿模型"认定生效;与 WAICO 提案几乎同步落地,全球AI治理进入"双轨并行"。Build Fast with AI
- 媒体报道Axios:AI"教父们"与三大实验室在监管框架上罕见趋同 — 核心共识是前沿模型上市前接受独立第三方测试——与行业沿用多年的"自我报告"模式正式分手。Axios
产品与应用
- 官方发布Kimi K3 已可通过官网、API 与 OpenRouter 使用 — 发布即全渠道可用:$3/$15 定价(缓存命中输入 $0.30),配套编码 agent 生态同步更新。Kimi 平台文档
- 官方发布WAIC 300款产品今起全球首发 — 人形机器人、具身智能与行业大模型扎堆亮相,四天会期里的中国AI产品总检阅。人民网英文版
- 媒体报道X 平台 Grok 图像/视频生成全量开放 — 文生视频工具 Hotshot 并入在即,Grok 正在成为 X 的平台默认层。SocialBee
- 媒体报道行业风向:从"更大"到"更可靠" — 7月发布潮的共同点是优化成本、可靠性与真实任务完成率;K3 用4项自动化评测第一给这个趋势又添一票。AIapps
深度视角
当"第三名"是开源的:K3 之后,闭源溢价还剩下什么
Kimi K3 最扎眼的不是2.8万亿参数,而是它在成绩单上的位置:GDPval-AA v2 全球第三,只输 Fable 5 Max 和 GPT-5.6 Sol Max,赢了 Opus 4.8;AA-Briefcase 第二;8项真实任务自动化评测拿下一半的第一。过去开源模型的角色是"闭源的平价替代",K3 第一次把开源放进了"frontier正面竞争者"的格子里——而且十天后任何人都可以把它下载回家。
这改变了三笔账。第一笔是价格账:K3 的 $3/$15 定价卡在 Sonnet 区间,却对标 Opus 以上的性能;当"性能第三"只收"性能第七"的钱,Fable 5 与 GPT-5.6 的溢价必须靠可靠性、生态与合规来辩护,而不能只靠榜单位次。第二笔是部署账:7月27日权重开放后,受数据主权约束的银行、政府与医疗客户第一次有了"自托管frontier"选项——尽管2.8T参数的推理集群门槛会把这个选项限制在大玩家手里,但"能不能"与"贵不贵"是两个性质的问题。第三笔是地缘账:中国开源模型已占美国企业30-46%的token消耗量,K3 在 WAIC 开幕当天登顶开源榜,技术渗透与治理叙事在同一周相互加持。
当然,所有成绩目前都是自报的。扩散在X上的怀疑并非抬杠:1M上下文的真实召回率、长任务的失败模式、以及第三方复测后的排名,都可能在两周内改写今天的结论。值得跟踪的信号:7月27日的开源许可条款(商用限制会直接决定冲击力)、Artificial Analysis 等第三方的独立复测、以及 Fable 5 免费期7月19日到期时 Anthropic 的定价动作——那将是闭源阵营对 K3 的第一个真实回应。