🔦 今日速览
DeepSeek V4 Pro正式版Agent能力大幅提升,DeepSWE基准从7.3飙升至62.7,超越Claude Opus 4.8,同时API峰谷调价正式生效,最高涨幅500%。AI视频平台Higgsfield以54亿美元估值融资4亿美元,年化收入达7亿美元。AI”数据工厂”Mercor开始收购倒闭公司内部聊天记录,报价高达30万美元。国内方面,宇树科技发布人形机器人”超人”,原地跳高2米超越人类纪录;阿里发布AI音乐模型HappyShrimp;360启动AI原生转型。
趋势1:AI模型定价从”烧钱获客”转向”算力稀缺定价”
趋势2:具身智能从工业走向消费级家庭场景
趋势3:AI训练数据从公开互联网向企业内部数据延伸
🌍 国际动态
1. 谷歌关闭Imagen 4,图像生成统一归入Gemini
事件简述:谷歌于8月17日正式关闭Imagen 4标准版、超清版和快速版三个图像生成端点,将所有图像生成能力统一整合至Gemini模型。这是谷歌将AI产品线全面围绕Gemini品牌整合的最新一步,此前Gemini已突破10亿用户里程碑。
关键数据:Imagen 4三个端点全面退役,Gemini统一接管图像生成。
影响分析:谷歌的AI产品线正在经历”品牌大统一”——从Bard到Gemini,从Imagen到Gemini Image,所有AI能力都被收归Gemini旗下。这既是消除品牌碎片化的战略举措,也意味着开发者需要再次迁移API。AI模型的快速迭代和退役正在成为常态,构建模型无关的灵活架构比以往任何时候都重要。📅8月17日
2. AI视频平台Higgsfield融资4亿美元,8个月估值翻四倍
事件简述:据《金融时报》报道,AI视频生成平台Higgsfield已从DST Global、高盛、Liberty Global和英特尔等筹得4亿美元,估值升至54亿美元。距其上轮13亿美元估值融资仅过去8个月,估值翻了四倍多。公司2025年才推出产品,如今年化收入已达7亿美元(一年前仅2000万美元),用户覆盖全球238个国家和地区、超3000万。
关键数据:融资4亿美元,估值54亿美元(8个月×4倍),年化收入7亿美元,3000万用户。
影响分析:Higgsfield的爆发式增长验证了AI视频生成在企业营销场景的刚需——从Dollar Shave Club等DTC品牌到企业广告,AI视频正从”玩具”变成”生产工具”。但高盛估计全球创作者经济规模2027年将达4800亿美元,这个赛道还很早期。Higgsfield主动从好莱坞电影转向企业客户,规避了版权雷区,这个策略选择值得关注。📅8月17日
3. AI”数据工厂”Mercor开始收购倒闭公司内部数据
事件简述:OpenAI和Anthropic背后的AI数据公司Mercor近期开始寻找倒闭或被收购的初创企业,购买其内部数据集。这些数据不仅包括代码库,还包括Slack聊天记录、Google Drive、电子邮件及Zoom会议录音等。AI智能体创业公司Warmly在宣布被HubSpot收购仅8天后,就收到Mercor的收购邮件,报价高达30万美元。
关键数据:单家公司内部数据报价高达30万美元,涵盖Slack/GitHub/Google Drive/邮件/会议录音。
影响分析:AI训练数据正从”公开互联网爬取”进入”企业内部数据挖掘”阶段。公开互联网的高质量数据已近枯竭,Mercor的做法代表了AI数据获取的新范式。但这也引发了严重的隐私和伦理问题——员工在Slack上的对话、内部会议录音,是否应该成为AI的训练数据?📅8月16日
4. xAI Grok 4.6追平GPT-5.6 Sol,价格仅为其40%
事件简述:xAI于8月14日发布Grok 4.6,在智能指数上追平GPT-5.6 Sol,但定价比其低60%以上(输入$2/百万token,输出$6/百万token)。在Agent基准测试中全面飙升,成为Cursor并入SpaceX后算力红利的首次释放。Grok 4.6与Cursor的结合,标志着SpaceX在AI编程工具领域的野心。
关键数据:追平GPT-5.6 Sol,定价低60%+,输入$2/输出$6每百万token。
影响分析:Grok 4.6的定价策略将前沿模型的”价格战”推向新高度。在Claude Opus 5、GPT-5.6 Sol、Grok 4.6三足鼎立的格局下,价格正在成为最关键的差异化因素。对开发者而言,这意味着用更少的钱获得顶级AI能力,但对模型提供商而言,盈利能力面临更大压力。📅8月14日
🇨🇳 国内动态
1. DeepSeek V4 Pro正式版发布,Agent能力超Claude Opus 4.8,API峰谷调价生效 ⭐
事件简述:DeepSeek于8月13日发布V4 Pro正式版(0813),Agent能力大幅提升。在AI编程智能体基准DeepSWE中,得分从Preview版的7.3飙升至62.7,超越Claude Opus 4.8;在AI安全智能体基准Cybergym和AutomationBench中甚至超越Claude Fable 5。同时,8月17日0时起API峰谷调价正式生效:V4 Pro高峰时段输出27元/百万token,空闲时段13.5元(半价);V4 Flash高峰9元,空闲4.5元。整体涨幅最高达500%,最低50%。
关键数据:DeepSWE 7.3→62.7(超Claude Opus 4.8),V4 Pro输出13.5-27元,V4 Flash输出4.5-9元,最高涨幅500%。
影响分析:DeepSeek从”价格屠夫”到”峰谷定价先行者”的转变,标志着中国AI模型竞争从”烧钱补贴”进入”算力定价”新阶段。高盛研报指出,这反映出国内AI需求持续旺盛、算力资源趋紧。V4 Pro正式版Agent能力的跃升(DeepSWE超越Claude Opus 4.8)更说明,中国AI模型在实用性上正快速追赶国际前沿。📅8月17日
2. 宇树科技发布人形机器人”超人”:原地跳高2米,速度超人类纪录
事件简述:宇树科技于8月17日发布人形机器人”超人”,腿长0.85米,原地跳高达2米,速度超越人类百米纪录。更令人惊讶的是研发周期——从立项到推出仅用3个多月。不过官方坦言运动控制和稳定性仍有完善空间。值得注意的是,8月12日宇树刚宣布仿生双足人形机器人累计生产下线约18000台。
关键数据:原地跳高2米,腿长0.85米,研发周期3个月,累计下线18000台。
影响分析:人形机器人赛道正从”能不能走稳”进入”能跑多快、跳多高”的性能竞赛阶段。宇树用超越人类纪录的数据抢眼球,但真正决定商业价值的还是成本、可靠性和场景适配度。18000台的下线量说明宇树在量产和供应链上已跑通规模,这是比极限性能更重要的信号。📅8月17日
3. 阿里发布AI音乐模型HappyShrimp,自然语言即可生成完整歌曲
事件简述:阿里巴巴于8月17日正式发布自研AI音乐生成模型HappyShrimp(快乐虾米)1.0版本。与市面上多数需要堆叠专业术语的AI音乐工具不同,HappyShrimp主打自然语言驱动创作,从作词、作曲、编曲到演唱全流程端到端生成。上线首日即宣布与太合音乐集团达成战略合作,并将于8月28-30日亮相阿那亚·虾米音乐节。
关键数据:端到端全流程生成,自然语言驱动,首日签约太合音乐,亮相虾米音乐节。
影响分析:阿里以”虾米”品牌回归音乐赛道,选择AI音乐生成作为切入点,既是情怀也是战略。HappyShrimp降低了音乐创作门槛,但AI音乐生成的版权争议和原创性质疑远未解决。太合音乐的合作是商业化的重要一步,但行业怎么消化、创作者怎么用、听众买不买账,才是真正的考验。📅8月17日
4. 360启动AI原生转型,周鸿祎要求管理者考核挂钩AI成果
事件简述:360集团创始人周鸿祎于8月17日发布全员信《用领导力驱动业务创新和组织变革》,宣布公司正式启动向AI Native组织的全面转型。要求各级管理者承担三项责任:推动至少一项AI产品创新、跑通至少一条AI重构的核心流程、提交至少一项亲自使用AI完成的实质性成果——这些指标直接纳入年度考核。
关键数据:三项AI考核指标纳入管理者年度考核,推动扁平化+加大校招生。
影响分析:把管理者考核与AI成果直接挂钩,在国内互联网公司中尚不多见。360的”All in Agent”战略从产品层延伸到了组织层,但能否真正改变组织基因,不看信写了什么,看半年后考核表上填了什么。很多公司的AI转型最后都变成了PPT转型。📅8月17日
5. 豆包上线手机远程控制电脑功能,AI助手从”对话”走向”执行”
事件简述:字节跳动旗下智能助手豆包近日更新”工作任务”模式,正式上线手机远程控制电脑功能。用户在手机端完成授权后,可随时接管同账号登录的电脑,远程查找本地文件、转换格式、生成总结并同步至手机。业内分析认为,这是智能助手从”对话问答”向”跨端执行”演进的一个标志性动作。
关键数据:手机远程控制电脑,支持单台手机关联多台电脑,短信验证绑定。
影响分析:AI助手不再只是”告诉你怎么做”,而是”帮你把事干了”。豆包将远程控制集成到智能助手里,省去了额外安装向日葵等工具的麻烦,对非技术用户更友好。但远程操控涉及隐私和安全,用户信任的建立需要时间。这个功能能否成为移动办公的新标配,取决于稳定性和安全感的平衡。📅8月17日
📄 今日论文
1. Twin:让AI编程Agent在测试时自我构建世界模型
作者:Twin团队 | 机构:未标注
核心贡献:提出Test-time World-model Inference(Twin)系统,让前沿编程Agent在遇到ARC-AGI-3等未知游戏时,自动编写可执行的世界模型来完成持续学习任务。传统方法需要为每个任务手工设计模型,Twin让Agent在测试时自主推理游戏规则并构建世界模型。
为什么重要:这与OpenAI GPT-5.6多智能体V2的思路一致——让AI Agent不仅能写代码,还能理解它所操作的”世界”。如果Agent能自主构建世界模型,其在开放环境中的适应能力将大幅提升。
📄 arXiv:2608.14490 📅8月14日
2. 智能爆炸的动力学:递归自我改进的数学分析
作者:独立研究者 | 机构:未标注
核心贡献:对AI递归自我改进可能导致的”智能爆炸”进行了严格的数学建模。论文分析了最极端情况下的动力学特征,探讨了驱动爆炸性增长的关键参数,以及什么条件下智能增长会趋于平缓而非爆炸。
为什么重要:随着DeepSeek V4 Pro、Claude Opus 5等模型在Agent基准上持续突破,AI自我改进的反馈循环正从理论走向现实。这篇论文为”智能爆炸”的讨论提供了数学框架,是AI安全研究的基础性工作。
📄 arXiv:2608.14426 📅8月14日
3. SheetCompass:让LLM理解电子表格的层次关系图
作者:SheetCompass团队 | 机构:未标注
核心贡献:提出SheetCompass框架,通过构建层次关系图来让LLM理解真实世界电子表格中的隐式跨表关联、细粒度列依赖和复杂空间布局。电子表格是半结构化数据中最广泛使用的格式,但LLM在处理多表关联、隐式依赖时表现不佳。
为什么重要:办公Agent是当前AI应用最热门的赛道之一(千问办公、百度库库AI、腾讯WorkBuddy、字节TRAE Work),而电子表格推理是办公场景的核心能力。SheetCompass为Agent理解企业级电子表格提供了新思路。
📄 arXiv:2608.14452 📅8月14日
4. PACE-Bench:通过代码进化测试Agent的物理适应性
作者:PACE-Bench团队 | 机构:未标注
核心贡献:提出PACE-Bench(Physics Adaptation via Code Evolution),一个测试自我进化Agent在动态环境中适应能力的基准。与现有评估在固定条件下优化不同,PACE-Bench测试Agent在环境条件改变后的恢复能力——当物理规则突然变化时,Agent能否通过代码进化快速适应。
为什么重要:自我进化是Agent从”工具”走向”自主系统”的关键能力。本周宇树科技”超人”机器人展示了硬件的极限性能,而PACE-Bench测试的是软件层面的适应能力——两者结合才是具身智能的完整图景。
📄 arXiv:2608.14441 📅8月14日