20260815-浙商证券-计算机周报_Harness成为Agent竞争新变量_12页_1mb
报告摘要
汉诺威成为Agent竞争新变量
核心内容概述
本周大模型行业重点聚焦在 Harness与Agent系统协同、模型价格与性价比、算力基础设施 三个方面。Harness作为Agent系统的重要组成部分,其开源和优化显著提升了任务效果和Token效率,标志着行业竞争从单一模型能力向“模型×Harness”系统能力延伸。同时,模型定价策略继续分化,企业对性价比的关注日益增强。此外,算力竞争进一步深入,从芯片采购向数据中心建设、异构推理基础设施扩展。
主要观点与关键信息
1. Harness与Agent系统协同成为竞争新焦点
- Agent能力提升:Harness作为Agent系统的基础设施,开始显著影响任务表现和Token效率。
- DeepSeek开源Harness v0.1:DeepSeek推出并开源DeepSeek Harness v0.1,采用MIT许可证,核心设计为“一切皆插件”,支持自由组合和扩展,上线一个多小时后GitHub Star即突破2.4万。
- ZCode优化GLM-5.2:ZCode通过上下文缓存复用优化,使GLM-5.2的Token缓存命中率超过98%,任务整体通过率提升2.39pct,表明Harness对任务表现具有重要影响。
- 模型能力并非唯一决定因素:在基座模型相同的情况下,Harness优化对任务表现有显著提升,说明系统协同能力的重要性。
2. 模型价格分化,企业关注性价比
- DeepSeek实施峰谷定价:DeepSeek V4 API正式采用峰谷定价,闲时价格为高峰时段的一半,显示对成本控制的重视。
- Anthropic维持优惠定价:Anthropic取消Sonnet 5的优惠期,将输入/输出价格永久定为2/10美元,但仍保持较高的企业采用率(43.5%)。
- Gemini 3.7 Flash性价比突出:Gemini 3.7 Flash的首发价格约为上一代Flash的一半,凸显其在成本效率方面的优势。
- 企业对高端模型的溢价敏感:尽管模型能力领先,但企业对额外性能的支付意愿有限,如Anthropic的Fable 5仅占企业模型支出的约11%。
3. 算力竞争向数据中心与异构推理基础设施延伸
- Anthropic与Riot Platforms达成长期算力协议:协议期限20年,提供191MW计算能力,显示头部厂商对算力资源的深度布局。
- DeepSeek招聘土木工程师:表明其正在构建数据中心规划、建设、测试和运营能力。
- 阿里云上线灵骏真武M890超节点实例:支持超大MoE模型推理,最高可承载十万亿参数级模型,是国内首个成功运行超2万亿参数大模型的超节点实例。
- OpenAI推出Ultrafast API服务:引入Cerebras算力,使GPT-5.6 Sol运行速度提升14倍,输出速率可达每秒750 tokens。
- 算力组织方式多元化:从芯片采购到数据中心建设,模型厂商正逐步掌控完整的算力基础设施。
国内厂商动态
DeepSeek
- V4 Pro正式上线:增强Agent能力,支持低/高/高强三种思考模式,适配OpenAI Responses API格式。
- 峰谷定价实施:闲时价格为高峰时段的一半,显示对成本控制的重视。
- 开源Harness v0.1:支持模型、工具、技能等自由组合,开发者预览阶段,GitHub Star迅速突破2.4万。
- 招聘土木工程师:构建数据中心全链条能力。
字节跳动
- 豆包推荐酒店订单单独计费:综合费率约12%,且不通过付费影响推荐结果。
- 成立AI数据与安全部门:覆盖数据生产全流程,包括标准制定、采购、清洗、评测等。
- 推出大学生优惠:学生认证后可获得2.5倍免费使用额度,月费38元即可订阅原价68元的专业版。
通义
- 千问推出付费方案:办公助理分三档,AI视频生成采用额度充值模式。
- 开源Qwen3.8-2.4T-A95B与Qwen3.8-27B:累计已开源460余个模型,Qwen全球下载总量超30亿次。
- 阿里云灵骏真武M890上线:支持超大MoE模型推理,国内首个成功运行超2万亿参数大模型的超节点实例。
- 模块化数据中心产能提升:交付周期缩短至约100天,建设成本降低10%以上。
智谱
- 发布GLM 5.3:编程能力提升50%,在多项公开基准中位居开源模型第一。
- ZCode升级四项能力:包括Goal、Subagents、Remote Control与闲时任务。
- ZCode用户突破100万:GLM Coding Plan额度重置,缓存命中率超98%,任务通过率提升。
- MaaS平台注册用户近700万:含约2.3万家企业客户。
- 启用5万块国产算力芯片:用于缓解推理需求增长。
MiniMax
- 发布MiniMax Music 3.0:支持生成最长5分钟完整歌曲,付费版1元/首。
- H3开源一周衍生模型近300个:ComfyUI版本下载量接近700万,生态热度显著。
Kimi
- 本周暂无重要更新。
海外厂商动态
Anthropic
- 与Riot Platforms签署20年算力协议:提供191MW计算能力,金额约91亿美元。
- 计划IPO估值上调至约2万亿美元:取决于上市进程和市场条件。
- 洽谈收购Decart AI:潜在交易金额约60亿美元,布局生成式视频和世界模型。
- Claude升级为Cowork会话:支持跨平台任务继续,Skills与Connectors可直接在浏览器使用。
- 推出Claude Managed Agents更新:包括预算控制、运行地区设置、加载Skills和顾问模型设置。
- Claude Sonnet 5维持优惠价格:输入/输出价格为2/10美元,永久保留。
- Claude Code新增跨会话消息功能:自动传递任务摘要,无需重复背景信息。
- 成立Theseus Infrastructure平台:与麦格理、GIC合作,专注定制数据中心建设。
OpenAI
- 企业采用率39.7%:低于Anthropic的43.5%,但Fable 5支出规模仍显著。
- 完成70亿美元股票回购:现任及前任员工可按当前估值出售股份。
- 收购NextSlide:将其产品整合至ChatGPT团队,支持生成可编辑演示文稿。
- 推出Premium Seats:定价为每用户每月125美元,标准席位为25美元。
- 发布GPT-5.6-Cyber模型:用于漏洞研究、验证和安全测试。
- Ultrafast API服务上线:引入Cerebras算力,提升推理速度和输出速率。
- 支持语音控制Agent:新增ChatGPT Voice功能,提升交互体验。
- 推出Mac版Computer History:记录用户互动事件,供AI调用。
- 与IBM合作:共同拓展金融、政府、电信、零售等行业方案。
- 测试付费重置额度功能:用户可支付8美元恢复每周额度。
- 全球用户超10亿:使用场景从问答工具向任务工具延伸,执行类消息占比明显提升。
风险提示
- 技术迭代不及预期:模型及Harness能力提升、Agent任务效果低于预期。
- 商业化变现不及预期:企业付费意愿及任务场景渗透弱于预期。
- 算力供给及资本开支压力超预期:数据中心、芯片及推理成本持续上升。
- 头部厂商竞争加剧:模型、价格、Harness与算力基础设施竞争进一步升温。
行业评级
- 看好(维持):行业指数相对于沪深300指数表现+10%以上。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载