- Kimi K3上线48小时用户暴增,算力逼近极限,暂停C端新用户订阅
- 马斯克宣布2万亿参数模型下周完成训练,月之暗面回应"欢迎加入2万亿+俱乐部"
- OpenAI战略主管批Kimi K3开源是"减速主义",硅谷多方反驳,开源vs闭源争论升级
- WAIC 2026闭幕,芯片到模型全面开源,中国AI开源大模型全球下载量突破100亿次
- 阿里Qwen3.8(2.4万亿参数)预览版上线,正式版即将发布并开源
- DeepSeek V4正式版测试曝光,性能接近Claude Opus4.8,有望下周发布
- 面壁智能开源1.5B参数具身智能模型,机器人"大脑"门槛大幅降低
- 鸿海首度拿下SpaceX 520亿美元AI服务器代工订单
- 字节发布Seed Audio 1.0,阿里发布Qwen-Audio-3.0-TTS登顶全球榜单
- Anthropic削减Claude Fable5订阅额度,Pro用户将无法访问

大模型巅峰对决:Kimi K3 引爆算力危机,巨头混战升级
Kimi K3 上线 48 小时算力爆仓,暂停 C 端新用户订阅
月之暗面新旗舰 Kimi K3 于 7 月 16 日发布——2.8 万亿参数、100 万 Token 上下文窗口,在 Arena AI 前端编程榜以 1679 分登顶全球第一。但上线仅 48 小时,用户请求量远超预期,现有算力集群逼近极限。
7 月 19 日晚,Kimi 团队紧急公告:暂停 C 端新用户订阅,所有算力优先保障已有付费用户。同步宣布未来将把「Kimi 主权益」与「Kimi Code 权益」拆分——后者因代码生成消耗算力远超普通对话,需独立计价。
据彭博社援引知情人士,K3 发布后日销售额增长至少六倍。公司年化收入(ARR)6 月已达 3 亿美元,较 4 月的 2 亿美元大幅跃升。月之暗面正推进新一轮融资,估值可能超 300 亿美元,并已向投资人分发股东决议,寻求赴港上市,最快六个月内完成。
深度解读 & 洞察:
- 这是国内大模型从「卷参数」转向「卷真实服务」的标志性事件。K3 不是输在能力,而是被用户热情「挤爆」——算力瓶颈已从训练侧蔓延到推理侧。
- 推理扩容没有捷径:训练可以排队,但用户每次对话都是实时算力消耗,只能一张卡一张卡往上堆。
- 权益拆分反映出不同场景的算力消耗差异巨大。代码 Agent 单次任务可能跑很久,拆开计价是资源精细化管理的必然方向。
影响:
- 对 AI 行业:短期看,算力供给紧张的厂商(芯片、服务器、云服务)估值逻辑强化;长期看,模型能力趋同后,基础设施能力成为核心壁垒。
- 投资启示:关注算力产业链(GPU、光模块、液冷、数据中心),同时也需警惕模型公司因算力瓶颈导致增长放缓的风险。
马斯克宣布 2 万亿参数模型下周完成训练,月之暗面喊话「欢迎加入」
7 月 18 日,马斯克在 X 平台透露旗下 2 万亿参数新模型将在下周完成初步训练,性能优于现有 1.5 万亿参数版本,「有可能超越 Kimi K3」。月之暗面随即在微博回应:「欢迎加入 2 万亿+俱乐部」。
深度解读 & 洞察:
- 全球大模型参数竞赛远未结束。K3 的 2.8 万亿、马斯克的 2 万亿、阿里 Qwen3.8 的 2.4 万亿——万亿参数已成新常态。
- 但参数规模只是门票,推理效率、上下文能力和 Agent 表现才是真实战场。马斯克强调新模型「推理速度和 Token 效率接近现有 1.5T 模型」,说明在追求规模的同时也在压缩成本。
OpenAI 战略主管批 Kimi K3 开源是「减速主义」,硅谷多方驳斥
OpenAI 新任战略未来主管 Dean W. Ball 公开批评 Kimi K3 开源,称开放权重模型「本质上是减速主义,会阻碍 AI 资本支出」,甚至建议美国政府「不需要证据」,只需通过制造监管恐慌来打压中国开源模型。
此番言论在硅谷引发激烈反弹。风险投资人 David Sacks 指责闭源实验室试图形成「双头垄断」,利用政府手段消灭开源竞争对手。Chamath Palihapitiya 直言「未来属于开源」。
深度解读 & 洞察:
- 这场争论本质是两种商业模式的冲突:OpenAI 和 Anthropic 依赖闭源 API 构建护城河,中国厂商则通过开源抢占生态位。
- Kimi K3 在性能追平甚至超越美国头部模型的同时保持低价($3/$15 per M tokens),直接威胁了闭源模型的定价权。
- Ball 的「监管武器化」建议暴露了一个趋势:AI 竞争正从技术层面上升到地缘政治和监管博弈。
Anthropic 大幅削减 Claude Fable5 订阅额度
从 7 月 20 日起,Anthropic 调整 Claude Fable5 订阅策略:Pro 和 Team Standard 用户将完全无法访问 Fable5,仅获一次性 100 美元使用额度;即便是 Max 和 Team Premium 用户,常规额度削减 33%,Fable5 实际可用额度仅剩调整后的 50%。
深度解读 & 洞察:
- Anthropic 承认 Fable 系列需求超预期,正在增加计算产能,但算力压力已直接影响用户体验和订阅策略。
- 在 OpenAI 推出 GPT-5.6 Sol 且价格更低、中国模型持续施压的背景下,高端模型的成本与定价矛盾正在激化。
- 这意味着 AI 行业已进入「算力配给」阶段——不再是「做不做得出」,而是「能否用得起、用得稳」。
WAIC 2026:开源从「可选项」变成「必选项」
工信部披露关键数据:中国 AI 开源大模型全球累计下载量突破 100 亿次
在 7 月 20 日的发布会上,工信部公布:今年 1-5 月软件业务收入超 6.2 万亿元(同比增 10.3%),开源鸿蒙生态设备累计超 13.5 亿台,国家级 AI 开源社区汇聚用户 1100 余万、托管模型超 7 万个。最引人注目的是,中国 AI 开源大模型全球累计下载量已突破 100 亿次。
深度解读 & 洞察:
- 100 亿次下载是一个里程碑级的数字,意味着中国开源模型已从「追赶者」变成全球 AI 基础设施的重要组成部分。
- 开源鸿蒙 13.5 亿台设备 + 100 多款行业发行版,说明开源不仅在模型层扩散,也在操作系统层形成了规模效应。
芯片层开源:平头哥 SAIL 全面开源,沐曦打出「AI 时代的 Android」
本届 WAIC 上,阿里旗下平头哥宣布将自研 AI 软件栈 T-Head SAIL 全面开源,覆盖 OS、SDK 到接口层,兼容 260+ 框架,迁移周期预估仅一周——目标直指英伟达 CUDA。其真武 AI 芯片已累计出货 56 万片,服务超 400 家客户。
沐曦则展示了更激进的生态策略:自研 MXMACA 软件栈开源以来汇聚超 50 万开发者,GitHub 近 5000 个热门项目中 92% 一行代码不改即可运行在沐曦 GPU 上。CTO 杨建将其定位为「AI 时代的 Android」。
深度解读 & 洞察:
- 国产 GPU 过去最大的痛点是「你的卡跑不了 CUDA」。开源软件栈的策略是用开放破局——让开发者自己适配,而非依赖厂商一对一移植。
- 沐曦「92% 零改动兼容」的数据很有说服力,说明开源路线的生态兼容性已经接近实用水平。
模型与生态层开源:从气象到科学,从端侧到安全
- 中国气象局开源千亿参数「风和」气象大模型,全球首个开源气象大语言模型。
- 上海科学智能研究院开放 110 亿参数「神珍」科学多模态模型,覆盖 DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。
- Arm 中国牵头发起「开源 AIOS 联盟」,20+ 成员覆盖芯片、模型、具身本体,瞄准端侧 AI 操作系统碎片化问题。
- 摩尔线程完成从零训练 MoE-236B 基础模型(25T+ tokens),跑通「国芯训练国模」全链路。
- 蚂蚁集团、阿里云正式加入 PyTorch 基金会。
阿里 Qwen3.8 领衔,各厂新品密集发布
阿里 Qwen3.8 预览版上线,正式版即将开源
阿里新一代大模型 Qwen3.8 拥有 2.4 万亿参数,预览版已在阿里云、Qoder 等平台上线,正式版近期发布并开源。团队称性能仅次于 Anthropic Fable 5。同步推出 Token Plan 个人版(39-499 元/月),白天 credits 消耗限时 1 折。
DeepSeek V4 正式版测试曝光,有望下周发布
多方消息显示 DeepSeek V4 正式版实测性能接近 Claude Opus 4.8,3D 生成能力超过 Opus。编码测试中生成 3000 行代码成本仅 0.12 美元,性价比突出。有分析认为其思维链风格更接近 Claude,输出简洁可读。
腾讯混元 Hy3 限免延长至 8 月 5 日
因用户呼声强烈,腾讯将 Hy3(295B 总参数 / 21B 激活,MoE 架构)的限时免费体验延长至 8 月 5 日。
字节跳动发布 Seed Audio 1.0 音频创作模型
在统一框架下联合建模人声、音效和环境声,支持 100ms 精度时间控制和 20+ 语种。多数场景音频可用率超 90%,单次生成最长约 2 分钟。
阿里 Qwen-Audio-3.0-TTS 登顶 Artificial Analysis 全球榜首
推出 Flash(首包 300ms)和 Plus(高品质)双版本,支持细粒度标签控制(如 [gasp]、[angry]),覆盖 16 种语言和 20 种方言。Plus 版在全部 16 种语言说话人相似度上均排名第一。
商汤发布 SenseNova U1 Pro:多模态「交付级」智能体
定位从「能生成」走向「能交付」,支持原生 8K 输出、长程 Agentic 闭环(数十轮自主迭代),图文与细节精准控制。
昆仑万维发布 Matrix-Game3.5 世界模型
5B 参数在 720p 下单卡 20FPS 实时生成,核心架构已开源。同步发布 Mureka v9.5 和 O3 音乐模型,支持版本化迭代创作。
具身智能加速:从实验室走向现实
面壁智能开源 MiniCPM-Robot:1.5B 参数把具身智能压进端侧
面壁智能发布 MiniCPM-Robot 系列——1.5B 参数的通用视觉-语言-动作(VLA)模型 RobotManip 负责操作,0.9B 参数的 RobotTrack 负责目标跟踪,全部开源。
- RobotManip 在长任务记忆测试 RMBench 中得分约 53 分,远超 π0.5 的约 10 分(接近随机水平)。
- 单次决策延迟约 120ms,约为 π0.5 的一半。
- RobotTrack 在单目标、多人干扰、模糊指令三种场景追踪率分别达 89.8%、73.4%、80.4%,均为开源最优。
- 配套推理框架 PhyAI 可将推理帧率从 10Hz 提升至 36Hz 以上。
深度解读 & 洞察:
- 1.5B 参数能在操作任务中与更大模型同台竞技,关键在压缩视觉 Token 和流式计算——只保留任务相关信息,历史计算可复用,不需要每帧从头算。
- 对开发者最实际的意义:一台宇树 Go2 Edu 机器狗 + 本地算力就能跑,不需要云端、不需要 API、断网也能用。
- 具身智能正从「大公司实验室专属」走向「个人开发者可及」,开源是关键变量。
宇树发布 UnifoLM-OminiA-0.3:机器人从感知到行动闭环
宇树在人形机器人 G1 上展示全模态交互理解:物品搬运、视觉识别问答、精细操作(如抓取特定层药盒)、设备控制(语音调节病床高度并听令即停)。单模型统筹家居康养多任务,实现全程自主执行与抗干扰。
苏度科技:仿真训练的机器人零样本抓取成功率约 98%
成立仅一年、估值超 200 亿元的苏度科技,在 WAIC 展示了四组 Demo:精密装配、柔性打包、移动操作和四机协同电池产线。CEO 韩铮表示,部署后成功率可达 99% 以上,更换型号后一两天内完成适配。其核心策略是以大规模仿真数据为主体,融合少量真机数据,在数据效率与泛化精度之间找平衡。
AI 基础设施军备竞赛
鸿海首度拿下 SpaceX 520 亿美元 AI 服务器代工订单
马斯克计划新建超 1.3 万个机柜的英伟达 GB300 服务器,以单机柜 400 万美元估算,总价高达 520 亿美元。鸿海借此打破戴尔、超微长期垄断 AI 服务器市场的局面,预计 Q4 交付。目前 SpaceX 的 Colossus 2 数据中心已部署超 55 万颗 GPU。
影响:
- 对 AI 供应链:鸿海(富士康母公司)股价利多;英伟达 GB300 需求得到超级大单验证,GPU 产业链整体受益。
- 投资启示:AI 服务器代工格局正在重塑,鸿海的进入意味着竞争加剧,戴尔和超微的份额可能被侵蚀。
更多基础设施动态
- 摩尔线程 MTT C256 超节点:首次在一层网络中实现 256 卡全互联,卡间延迟压缩至亚微秒级,两个标准机柜即可部署。已完成 MoE-236B 模型从零完整训练。
- 百度昆仑芯 M100 芯片首展:第四代自研 AI 芯片,面向大模型推理优化,主打通用、高效、经济。
- Etched 洽谈 200 亿美元估值融资:低电压 AI 芯片初创企业,其芯片数学模块电压比竞品低 50% 以上,去年 12 月刚以 50 亿美元估值融资 5 亿美元。
- Anthropic 被曝成为 AMD 新客户:代码泄漏显示 Anthropic 正在引入 AMD GPU,降低对英伟达的单一依赖。
- 阿里云推出「智能体专用型实例」:将计算、存储、网络与大模型 Token 打包,入门级 2 核 2G + 2 亿 Token 包月 262.5 元。
- 三星利润暴增 1800%:AI 芯片需求推动半导体行业强劲复苏。
AI 安全与治理:新威胁与新思考
Hugging Face 遭 AI 智能体自主攻击
全球最大 AI 模型平台 Hugging Face 披露,一个由自主式 AI 智能体发起的网络攻击导致内部数据集及部分服务凭证遭到未授权访问。攻击者利用恶意数据集触发平台代码执行漏洞,随后横向渗透多个内部集群。整套攻击流程均由 AI 智能体框架自动完成。
值得关注的是,Hugging Face 安全团队在调查中先尝试用美国商业大模型 API 分析攻击日志,但该模型因安全策略误判而拒绝提供分析。最终团队使用中国开源模型 GLM 5.2 在本地部署完成取证。
深度解读 & 洞察:
- 这是 AI 智能体被用于真实网络攻击的标志性案例,意味着攻击者可以低成本实现自动化、规模化的渗透行动。
- 安全分析依赖商业 API 存在「被审查」风险——平台的安全策略可能无意中阻碍调查。本地部署开源模型在数据安全和灵活性上优势明显。
OpenAI 提出「有用智能每美元」新衡量标准
OpenAI 提出全新 AI 价值评估框架,围绕四个维度:完成了多少有用工作、一个成功任务实际花了多少钱、AI 正确完成工作的频率(可靠性)、以及随着使用量增长每美元投入能否完成更多工作。核心理念是:真正的成本不是 token 单价,而是产出一个成功结果的完整代价。
研究:AI 会削弱人类批判性思维
法国和意大利多所大学研究发现,获得 AI 建议后,人类承认「不知道」的比例从 44% 骤降至 3%,但准确率反而从 27% 降至 9%,自信程度却从 30% 升至 76%。即便引入金钱激励,效果改善也有限。
更多动态
- 月之暗面重做 Transformer 三大基础组件:优化器 Adam 换成 MuonClip、全注意力换成 Kimi Linear、残差连接换成 Attention Residue,全部开源。MuonClip 让同样数据的训练效果接近数据量翻倍;Kimi Linear 是首个在长短上下文任务上全面超越全注意力的架构。
- Netflix 以 5.87 亿美元收购 AI 电影公司 InterPositive:由本·阿弗莱克联合创立,开发 AI 辅助影视后期制作工具。Netflix 已有约 300 部影片采用生成式 AI 技术。
- Meshy 完成近 4 亿美元 B 轮融资,估值超百亿:AI 3D 赛道迄今最高估值,年营收翻 12 倍,注册用户超 1200 万。下一步进军实时互动多模态内容体验。
- Google DeepMind 发布 GenCeption 视觉模型:用视频生成模型做深度估计、图像分割、3D 姿态估计,训练数据仅为现有模型的 1/7 到 1/500。
- 阿里云百炼上线 HappyOyster 1.0:支持实时交互的开放世界模型,已开放 Android、iOS 及 Web 三端 SDK。
- 智象未来发布 vivago R1:支持任意时长连续视频生成,商业可用率 85%。
- 天谱乐 V4.7 发布:AI 音乐从「一键成曲」走向「随心修改」,强化 Remix 改写和翻唱能力。
- Ollama 完成 8800 万美元融资:890 万开发者使用,85% 的财富 500 强企业用户。
- 美团 LongCat 推出 LoHoSearch 新基准:让搜索智能体成绩从 90% 跌回 34%,重新打开能力评测空间。
- 中科院发布 AI for ADANES 核能技术路线:全球首个 AI 驱动第四代核能系统方案,铀资源利用率可从 1% 提升至 95%。
- Linux 基金会启动 x402 基金会:为 AI 智能体打造互联网原生支付层,Visa、万事达、AWS、Google 等 40 家机构加入。
- Epoch AI 研究:AI 文本检测器面对风格模仿文本漏检率显著上升:学术风格 AI 文本漏检率最高达 29%。
- 中软国际与月之暗面签署 Token 分成合作协议:共建 FDE 创新实验室,聚焦能源电力行业 Agent 落地。
- transcribe.cpp v0.1.0 开源:统一语音转录库,支持 16 个 ASR 模型族、60+ 模型。
- 小鹏汽车 AI Infra 负责人陆思渊将离职加入 OpenAI:负责自研芯片编译器与推理部署,团队将被拆分为三个独立团队。
- 王祖贤息影 22 年后授权 AI 形象:网易《天下》推出 AI 短片《倩影》。
- 德国政府将办公文档标准统一为 ODF:2027 年前完成迁移,推进「数字主权」战略。
