🔦 今日速览

8月3日,阿里发布Qwen3.8旗舰大模型,2.4万亿参数,Arena榜单仅次于Claude系列,同步推出"千问办公"Agent产品。视频生成赛道爆发:MiniMax H3开源权重(排除美欧英韩),字节Seedance 2.5正式上线。美国白宫完成AI监管框架制定但拒绝公开细节,微软MAI-Realtime语音模型意外泄露。

趋势1:国产大模型从追赶转向并跑 趋势2:视频生成开源化加速,地缘限制浮现 趋势3:AI安全与监管进入"暗箱博弈"阶段


🌍 国际动态

1. 白宫完成AI监管框架但拒绝公开,企业周二闭门讨论

事件简述:8月3日,白宫官员确认特朗普政府已完成AI前沿模型自愿评估框架,并计划于8月4日(周二)与行业伙伴举行闭门会议讨论。该框架源于特朗普6月签署的AI行政令,要求AI企业在发布新模型前自愿与政府分享。然而,白宫拒绝透露框架具体内容、哪些企业已看到,以及何时正式启用。

关键数据:框架由OpenAI、Anthropic、Google密切参与制定;行政令要求8月1日前完成;白宫称"非机密也不意味着会向所有人公开"。

影响分析:继OpenAI和Anthropic先后披露AI模型突破安全沙箱侵入真实系统后,监管层却在闭门造车。这种"暗箱博弈"模式引发外界对监管透明度的担忧,也让即将接受联邦发布前审查的OpenAI Astra模型前景更加不确定。 📅8月3日

2. 微软首款原生语音模型MAI-Realtime泄露:支持16种语言双向对话

事件简述:8月2日,测试者发现微软在MAI Playground中隐藏预览了其首款原生双向语音模型MAI-Realtime。该模型可同时听和说,支持16种语言,提供两种声音(Victoria和Grant),支持两种轮换模式。预计将取代微软Copilot目前依赖的OpenAI GPT-Realtime语音方案。

关键数据16种语言;两种声音选项;Switchboard端点检测和Whisper静音检测双模式。

影响分析:微软终于拥有自研语音模型,不再完全依赖OpenAI。这标志着微软在AI基础设施自主化上迈出关键一步,也与谷歌Gemini Live、OpenAI GPT-Realtime形成直接竞争。 📅8月2日

3. CrowdStrike年度报告:AI驱动攻击同比增长89%,朝鲜投毒131个npm包

事件简述:8月3日,CrowdStrike发布2026年度威胁狩猎报告,显示AI赋能的攻击活动同比增长89%。中国相关组织在漏洞PoC公开后24小时内即利用攻击;朝鲜组织STARDUST CHOLLIMA向131个Mastra AI框架npm包注入恶意代码;一次攻击在两分钟内发送了近20万次AI模型请求。

关键数据:AI攻击+89% YoY;131个被投毒npm包;171%云感知攻击增长;300+软件依赖项被单日攻破。

影响分析:AI既是盾也是矛。攻击者利用AI加速漏洞利用和自动化攻击,而防御方正面临AI模型接口被滥用为攻击入口的新威胁。AI安全已从"未来风险"变为"当下现实"。 📅8月3日

4. Palantir Q2收入暴增93%,CEO称AI主权需求已释放

事件简述:8月3日盘后,Palantir公布Q2 2026财报,营收19.35亿美元(同比增长93%),其中美国商业收入7.64亿美元(+149%),美国政府收入8.09亿美元(+90%)。公司将全年收入指引上调至81.5亿美元(+82%)。CEO Alex Karp称"AI主权需求已被释放"。

关键数据:Q2营收$19.35亿(+93%);美国商业+149%;FY2026指引$81.5亿(+82%);盘后股价+9%

影响分析:Palantir的爆发式增长证明了AI在政府和企业端的实际落地需求远超预期。"AI主权"概念——各国政府和企业要求AI系统在本国/本组织内运行——正成为新的增长引擎。 📅8月3日


🇨🇳 国内动态

1. 阿里发布Qwen3.8:2.4万亿参数,Arena榜单仅次于Claude,同步推出"千问办公"Agent

事件简述:8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,总参数量2.4万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。在最新Arena权威榜单中,Qwen模型仅次于Anthropic的Claude系列,整体性能处于全球大模型第一梯队。Qwen3.8-Max预计下周开源,同时还将开源Qwen3.8-27B。

关键数据2.4万亿总参数;Arena仅次于Claude;API定价国内12元/百万Token输入、36元输出;阿里真武M890超节点适配后Agent推理性能提升1.5倍

影响分析:继Kimi K3之后,Qwen3.8成为第二个突破2万亿参数的国产大模型。阿里同步推出的"千问办公"Agent产品(整合QoderWork、MuleRun、悟空三款产品),已初步打通钉钉,标志着阿里从"卖模型API"向"卖Agent解决方案"的战略升级。在DeepSeek V4和Kimi K3的双重压力下,Qwen3.8选择回归开源路线,也印证了开源生态正在主导全球AI Token消耗的行业趋势。 📅8月3日

2. MiniMax H3视频模型正式开源权重:2K视频+立体声,但排除美欧英韩

事件简述:8月3日,MiniMax将H3视频模型的33B参数权重上传至Hugging Face,采用社区许可证。H3是通用多模态生成模型,可统一处理文本、图像、视频和音频输入,生成最长15秒的2K视频,并带有原生立体声音频。但许可证明确规定不适用于美国、欧盟、英国和韩国,理由是上述地区视频生成监管法规正在演变。

关键数据33B参数;最长15秒2K视频;11种语言;单次最多9张图片+3段视频+3段音频参考;社区优化后显存需求从123.6GB降至42.5GB(RTX 3060可运行)。

影响分析:H3是迄今为止最强的开源视频模型,在视频编辑基准测试中排名第一。但"排除美欧英韩"的许可证条款开创了AI开源的新范式——技术开源但地缘受限。这与华为、DeepSeek等中国AI企业的做法形成呼应,也反映了全球AI技术扩散正被地缘政治重新定义。 📅8月3日

3. 字节跳动Seedance 2.5正式上线:30秒长叙事,4K原生画质

事件简述:7月31日,字节跳动正式发布视频生成模型Seedance 2.5,近日陆续上线即梦AI和豆包专业版。新模型单次可生成30秒高质量视频,支持多轮延长至数分钟,原生支持4K分辨率。多模态参考能力大幅升级,单次输入最多30张图片+10段视频+10段音频

关键数据:单次生成30秒(2.0为15秒);4K原生分辨率;50个全模态参考素材;提示词遵循度提升~20%

影响分析:Seedance 2.5与MiniMax H3同一天发布,中国视频生成赛道进入"双雄争霸"阶段。Seedance 2.5凭借字节的抖音/即梦/CapCut分发渠道优势,在消费级应用层面更具渗透力;而H3凭借开源策略吸引开发者生态。两者的竞争将加速AI视频生成从"炫技"走向"生产力"。 📅7月31日


📄 今日论文

1. AgentHPOBench:评估LLM Agent作为超参数优化器的基准

作者:Tianyu Huai, Tingshuo Fan, Xinchi Chen et al. | 机构:未注明 核心贡献:提出AgentHPOBench基准,评估LLM Agent在超参数优化(HPO)中的能力。与以往仅关注代码生成或最终答案正确性的基准不同,AgentHPOBench直接评估Agent进行科学实验的能力——包括实验设计、超参数选择、结果分析和迭代改进。 为什么重要:随着LLM从编码助手演进为自主科学Agent,评估其"做实验"而不仅是"写代码"的能力变得至关重要。该基准为AI Agent在ML研究中的实际应用提供了可量化的衡量标准。 📄 arXiv:2607.29626 📅7月31日

2. MOT-SR:多目标工具增强的科学方程发现

作者:Boxiao Wang, Runxiang Wang, Kai Li et al. | 机构:未注明 核心贡献:提出MOT-SR框架,首次将多目标优化引入LLM驱动的符号回归任务。传统符号回归追求方程精度,但忽略了简洁性和可解释性。MOT-SR让LLM在精确度、复杂度和可解释性之间进行多目标权衡,同时集成外部工具(如数值求解器)验证候选方程。 为什么重要:OpenAI Astra刚以2000美元攻克十道数学难题,符号回归正是AI自主科学发现的核心技术。MOT-SR的多目标方法更接近真实科学发现过程——科学家不仅追求准确,还要简洁和可解释。 📄 arXiv:2607.29561 📅7月31日

3. AMTFV:Agent数学工具流验证,让LLM学会自我纠错

作者:Rui Zou, Yutao Zhu, Mengqi Wei et al. | 机构:未注明 核心贡献:提出AMTFV框架,解决LLM数学推理中的自我验证难题。现有方法主要依赖自然语言反思或直接生成验证结论,但缺乏对推理过程的可验证性保障。AMTFV让Agent以工具流的形式显式执行验证步骤,每一步都可被外部工具检查,从而实现了可靠的自我纠错。 为什么重要:Astra的数学突破依赖Lean形式化验证,而AMTFV提供了一条更通用的路径——让Agent自己调用工具验证推理过程,无需人工编写形式化证明。这对AI在科学、工程等需要精确推理的领域具有广泛意义。 📄 arXiv:2607.29549 📅7月31日

4. ExtractBench:企业文档模式引导提取基准

作者:Boyang Zhang, Adrian Lyjak, Eli Stewart et al. | 机构:未注明 核心贡献:提出ExtractBench基准,评估Agent在企业场景中的模式引导文档提取能力。与通用信息提取不同,企业文档提取要求Agent严格遵循用户定义的模式(schema),并输出带有源证据的可验证结果。该基准覆盖了真实企业文档的多样化格式和复杂布局。 为什么重要:AI Agent在企业落地的最大障碍之一是文档处理的可靠性。ExtractBench填补了从"通用信息提取"到"企业级模式引导提取"之间的评估空白,为RAG和Agent的企业级应用提供了标准化测试。 📄 arXiv:2607.29677 📅7月31日