🔦 今日速览

7月29-31日,AI行业迎来密集动态。Meta CEO扎克伯格在Q2财报电话会上预测,5年内数十亿人将拥有7×24小时工作的个人AI代理,Meta同时宣布与贝莱德合作140亿美元建数据中心。Stripe正洽谈以约100亿美元收购AI模型路由平台OpenRouter,估值达年收入70倍。DeepMind宣布解散诺贝尔奖获奖团队AlphaFold,核心成员转投Anthropic。国内方面,DeepSeek V4-Flash正式公测,华为开源5050亿参数盘古大模型,MiniMax发布H3全模态模型。

趋势1:个人AI代理从概念走向平台级竞赛 趋势2:AI基础设施收购潮来临,模型路由成新入口 趋势3:大模型开源阵营持续壮大,国产三强同日发力


🌍 国际动态

1. 扎克伯格:5年内数十亿人将拥有个人AI代理,Meta豪掷1400亿美元押注

事件简述:7月29日,Meta CEO扎克伯格在Q2财报电话会上作出大胆预测——"5年后,几乎不可能出现数十亿人不拥有个人AI代理的情况"。他描绘的未来中,AI代理将7×24小时工作,管理用户的健康、财务、人际关系和家庭事务,成为"理解你目标"的终身数字助手。同日,Meta宣布与贝莱德合作投资140亿美元建设1GW级数据中心园区。财报显示Meta Q2收入强劲,但自由现金流同比暴跌91%,全年资本支出上调至1300-1450亿美元

关键数据:140亿美元数据中心合作;全年资本支出1300-1450亿美元;Q2自由现金流暴跌91%;Instagram日活突破20亿

影响分析:扎克伯格的预测标志着AI行业叙事从"工具"到"代理"再到"个人数字生命"的跃迁。Meta的策略是用重资本换取AI代理和企业服务的入口——即使自由现金流暴跌也在所不惜。这一策略与OpenAI、Anthropic形成差异化竞争:Meta押注的是"每个人都有一个AI"的消费级愿景,而非企业级API服务。 📅7月29日

2. Stripe洽谈100亿美元收购OpenRouter:支付巨头押注AI模型路由

事件简述:据《华尔街日报》7月29日报道,支付巨头Stripe正洽谈收购AI模型路由平台OpenRouter,交易估值约100亿美元。OpenRouter已接入400+个AI模型,服务500万+开发者,年化收入约5000万美元,毛利率约70%。该估值约为年收入的200倍,远超此前SpaceX收购Cursor的22倍。同期,Cursor、Meta、Ramp等公司也纷纷布局模型路由产品。

关键数据:估值100亿美元;年收入5000万美元(200倍PS);毛利率70%;接入400+模型;500万+开发者。

影响分析:Stripe收购OpenRouter的逻辑是"掌控AI经济的基础设施层"——正如支付是互联网的收费层,模型路由可能成为AI Agent经济的收费层。当前AI公司依赖单一模型提供商的API,OpenRouter则提供中立切换能力,避免被单一巨头锁定。Stripe的1590亿美元估值和支付基础设施,为AI模型市场提供了天然的交易层。 📅7月29日

3. DeepMind解散诺贝尔奖团队AlphaFold,诺奖得主率核心成员转投Anthropic

事件简述:据《金融时报》7月29日报道,Google DeepMind已解散其诺贝尔奖获奖团队AlphaFold,将大部分研究人员重新分配至Gemini项目和Isomorphic Labs。诺奖得主John Jumper已于6月离职加入Anthropic,两位核心AlphaFold研究员Jonas Adler和Alexander Pritzel紧随其后。近四分之一原团队成员已离开DeepMind。DeepMind表示"战略已转向由Gemini驱动的AI科学家系统"。

关键数据近25%原团队成员离开;诺奖得主John Jumper+2位核心研究员转投Anthropic;AlphaFold蛋白质结构数据库已收录2亿+预测结构。

影响分析:AlphaFold是DeepMind的皇冠明珠——2024年诺贝尔化学奖的核心成果。团队解散标志着Google从"深度科学突破"转向"AI科学家商业化"的战略转向。Jumper等人加入Anthropic,可能意味着Anthropic正在加速布局AI+生物制药赛道,与Isomorphic Labs形成直接竞争。 📅7月29日

4. Anthropic"巴拿马计划"曝光:破坏性扫描200万本实体书引发伦理风暴

事件简述:Anthropic的秘密项目"巴拿马计划"细节于7月31日曝光。该公司为搭建Claude训练数据集,大规模采购二手实体书,通过裁切书脊高速扫描后直接销毁原书,累计超200万本实体书被不可逆损毁。同时,Anthropic还被曝批量抓取盗版网站超700万册电子书搭建BOOK3数据集。Anthropic此前已因盗版图书训练与美国作家达成15亿美元和解协议。

关键数据:200万+实体书被销毁;700万+盗版电子书被抓取;15亿美元作家和解金。

影响分析:此事引发AI数据采集伦理的根本性质疑——"将人类公共文化遗产转化为私有算法资源"是否合法合理?马斯克公开表态反对破坏性扫书,倡导无损扫描。这一争议可能加速AI训练数据采集的立法进程,推动"数据溯源"和"文化保护"成为AI监管的新维度。 📅7月31日

5. OpenAI低调开源Codex Security CLI,已修复3000+高危漏洞

事件简述:OpenAI于7月29日正式开源Codex Security CLI和TypeScript SDK(Apache 2.0协议),Hacker News在官方宣布前就发现了仓库。该工具前身为内部项目"Aardvark",在封闭预览期间已帮助用户修复3000+高危漏洞。工具采用"发现→沙箱验证→修复"流水线,可集成CI/CD,支持本地和云端扫描,直接对标Anthropic的Claude Security。

关键数据:Apache 2.0开源;封闭预览期修复3000+高危漏洞;npm包@openai/codex-security;支持GitHub CI/CD集成。

影响分析:OpenAI开源Codex Security CLI标志着AI安全工具市场进入正面竞争阶段。此前Anthropic率先推出Claude Security,OpenAI的反击选择开源策略——用社区生态对抗闭源商业服务。这一定位与GitHub Copilot的"开源基础+商业增值"模式一致。 📅7月29日

6. NVIDIA在SIGGRAPH 2026发布Cosmos-Dreams:数据从"采集"变为"计算"

事件简述:NVIDIA在SIGGRAPH 2026大会上发布Cosmos-Dreams神经闭环模拟器,Cosmos实验室VP刘明宇提出核心理念:"数据不再是你采集的东西,而是你计算的东西。"Cosmos-Dreams可从单帧图像生成完整虚拟世界,在单张RTX PRO 6000 GPU上实时运行,支持自动驾驶、机器人等物理AI在闭环虚拟环境中训练和验证。

关键数据:单张RTX PRO 6000 GPU实时运行;从单帧生成完整世界;支持自动驾驶和机器人训练。

影响分析:世界模型正成为物理AI的数据引擎。Cosmos-Dreams将仿真从"静态数据生成"升级为"动态闭环训练",意味着机器人可以在虚拟世界中完成数百万次试错,再迁移到真实世界。这对训练成本高昂的具身智能领域是革命性的。 📅7月29-30日


🇨🇳 国内动态

1. DeepSeek V4-Flash正式公测,V4-Pro旗舰模型8月初上线

事件简述:7月31日,DeepSeek正式上线V4-Flash模型正式版API公测服务,定位高效低成本推理场景。V4-Flash采用轻量化MoE架构,总参数284B,单次激活仅13B,支持百万级超长上下文,可自由切换思考与非思考双模式。百万Token场景下单Token计算量仅为前代的27%,显存占用降至10%。定价极具竞争力:缓存命中输入仅0.2元/百万Token。同时官宣迭代旗舰模型DeepSeek-V4-Pro将于8月初正式发布。

关键数据:284B总参数/13B激活;百万Token算力降至27%;显存降低90%;输入0.2元/百万Token;原生兼容OpenAI Responses API格式。

影响分析:DeepSeek V4-Flash的发布标志着国产大模型正式进入"高性价比商用"阶段。0.2元/百万Token的定价将AI推理成本压到历史新低,直接挑战OpenAI Luna和Claude Sonnet的价格体系。V4-Pro的预告则暗示DeepSeek正在构建"Flash普及+Pro旗舰"的双层产品矩阵。 📅7月31日

2. 华为开源openPangu-2.0-Pro:5050亿参数国产大模型,昇腾原生训练

事件简述:7月31日,华为正式开源openPangu-2.0-Pro旗舰大模型,同步开放模型权重、推理代码与完整技术报告。该模型为昇腾NPU原生训练的MoE架构,总参数5050亿,单次Token激活18B,支持512K超长上下文,训练数据34T Tokens。经过多轮SFT、强化学习与在线蒸馏优化,在长文本理解、逻辑推理等核心能力上大幅提升。

关键数据:5050亿总参数;18B激活参数;512K上下文;34T Tokens训练数据;昇腾NPU原生训练。

影响分析:华为开源盘古Pro是国产AI"去英伟达化"的重要里程碑——模型从训练到推理完全基于昇腾生态,证明国产算力已能支撑5000亿参数级大模型的全流程。开源策略延续了华为在HDC 2026上承诺的路线,为国内企业提供了一条不依赖CUDA的AI基础设施路径。 📅7月31日

3. MiniMax发布H3全模态模型:2K视频生成成本仅为竞品三分之一

事件简述:7月31日,MiniMax稀宇科技正式推出H3全模态生成模型,统一支持文本、图片、视频、音频的理解与生成。H3原生支持双声道2K高清视频输出,最长15秒,2K分辨率生成单价不足主流竞品三分之一,768P成本仅为行业半数。模型已适配多款国产芯片,后续将合规开源权重与基础代码。

关键数据:2K分辨率成本竞品1/3;768P成本行业1/2;最长15秒视频;原生双声道音频;已适配国产芯片。

影响分析:MiniMax H3以"全模态+高性价比"策略切入国产视频生成赛道,直接在价格上对标Runway和Pika等海外产品。开源承诺进一步降低了国内开发者的使用门槛。H3的发布补齐了开源领域高端视频生成模型的短板,与Seedance、Vidu等形成国产视频生成多强格局。 📅7月31日

4. 字节跳动整合飞书与豆包团队,豆包月活3.82亿、ARR达40亿美元

事件简述:字节跳动近期宣布AI业务组织架构重大调整:飞书产品团队并入豆包,由豆包负责人赵祺统筹,飞书负责人谢欣向其汇报;飞书GTM团队与火山引擎整合为"创造力服务平台",由谭待负责。数据显示豆包月活3.82亿,字节大模型ARR已达40亿美元。同一天,火山引擎公布Seedance 2.5视频生成定价:5秒720P视频约7.56元,最长可生成30秒

关键数据:豆包月活3.82亿;字节大模型ARR 40亿美元;Seedance 2.5单次生成7.56元/5秒;最长30秒视频。

影响分析:字节此次组织调整的核心逻辑是"AI能力与办公场景的深度绑定"——将豆包大模型的智能交互能力融入飞书协同办公全链路,对标微软Copilot和Google Workspace AI。40亿美元ARR意味着字节大模型已成为仅次于OpenAI和Anthropic的全球第三大AI商业收入体。 📅7月31日

5. 国家发改委:全国智能算力达去年同期2.8倍,国产大模型总下载量突破100亿次

事件简述:7月31日,国家发改委在7月新闻发布会上披露AI产业关键数据:截至6月底,全国智能算力规模达到去年同期的2.8倍;首个全国产10万卡AI超集群正式投用;国产大模型全球总下载量突破100亿次;建成高质量数据集超过12万个。发改委表示"算力、模型、数据互促共进的良性循环加速形成"。

关键数据:智能算力2.8倍增长;10万卡国产超集群;100亿次下载量;12万+高质量数据集。

影响分析:这组数据从政策层面确认了中国AI基础设施的爆发式增长。2.8倍算力增速和10万卡超集群的投用,标志着中国在AI算力自主可控方面取得实质性进展。100亿次下载量则反映了中国开源大模型在全球的广泛影响力。 📅7月31日


📄 今日论文

1. GoGoTB:基于Agent的芯片验证全自动框架

作者:Xin et al. | 机构:未注明(工业界) 核心贡献:提出GoGoTB,一个实现芯片RTL验证全流程自动化的Agent框架。通过三个子系统——Agent执行控制层、可演进知识系统和规格锚定覆盖率闭环——实现从环境搭建到覆盖率收敛的端到端自动化。在8个RTL设计上无需人工干预,实现100%环境生成成功率和平均98.4%行覆盖率、83.2%功能覆盖率。 为什么重要:芯片验证是IC设计中最耗时的环节,一个漏掉的Bug可能导致数亿美元的流片重做。GoGoTB首次证明Agent能端到端完成这一任务,对半导体行业AI应用有直接推动意义。 📄 arXiv:2607.26181 📅7月28日

2. HANDBOOK.md:企业Agent长期政策遵循基准测试

作者:7位研究者 | 机构:未注明 核心贡献:提出HANDBOOK.md基准,包含65个Agent任务,模拟企业员工遵循公司手册的场景。每个任务配备20-124页的SOP文档,Agent需在5个领域(财务、医疗账单、保险、物流、HR)中严格遵守政策。在824项严格通过标准下,最强模型仅通过36.2%的测试,暴露出Agent在长期政策遵循方面的严重不足。 为什么重要:企业部署AI Agent时假设"给一份政策文档,Agent就会遵守"——这个基准证明了这一假设远未成立。Agent常常让"看似合理的请求"覆盖政策文档,或在执行检查后反而违背检查结果。对正在部署Agent的企业是重要警示。 📄 arXiv:2607.25398 📅7月28日

3. 叙事锚定:相同事实、不同诊断——临床LLM的社会语言偏见

作者:未注明 | 机构:未注明 核心贡献:发现并量化了"叙事锚定"(Narrative Anchoring)现象——相同的临床事实以不同社会语言风格表达时,LLM的诊断结果显著不同。在1000个USMLE临床案例中,7个模型的叙事锚定偏差达0.064-0.151。提出NarrativeShield三Agent管线,通过结构化提取和验证临床事实后再诊断,将偏差降至接近(-0.004至0.037)。 为什么重要:这不是"种族偏见"而是"语言风格偏见"——患者描述症状的方式会影响AI诊断,与实际病情无关。对医疗AI的安全部署有直接警示意义,提供了可落地的缓解方案。 📄 arXiv:2607.27384 📅7月31日

4. LayerRAG-Bench:Agent RAG系统的跨层可靠性基准

作者:未注明 | 机构:未注明 核心贡献:提出LayerRAG-Bench,一个从证据层、工具合约层、授权层和会话状态层四个维度评估Agent RAG系统可靠性的基准。涵盖8个企业领域、240个任务、9种故障场景。发现模式规范化可将模式漂移成功率从0.000提升至0.913,但过期证据、缺失工具输出、权限拒绝和错误会话上下文等问题无法通过模式规范化修复。 为什么重要:当前的RAG评估主要关注"答案是否基于检索证据",但忽略了工具调用失败、权限错误、会话状态混乱等更底层的故障。LayerRAG-Bench证明"接地性评估"会产生大量误报(在过期证据和错误会话下),为Agent可靠性评估提供了更全面的框架。 📄 arXiv:2607.27353 📅7月31日