返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序

【东吴证券】传媒行业深度报告:诸侯混战,国模出海——大模型2026年中复盘及展望-260707(19页).pdf

2026-07-08
文档编号:1275939
文档页数:19
文档大小:2.04MB
下载积分:VIP专享
文档格式:PDF
核心结论速览: Scaling Law没有失效,而是换了一个活法:真正发生的不是Scaling Law失效,而是单一维度的参数堆叠遇到了边际收益递减,多模态、Multi-Agent、RSI(递归自改进)、世界模型的scaling空间正在被打开。预训练决定天花板,后训练决定能触及天花板的高度。 Frontier model交替领先,领先优势半衰期急剧缩短:2025年11月Google凭Gemini 3短暂领先,2026年初Anthropic靠coding反超,Q2 OpenAI凭GPT 5.5/5.6回归。大模型第一的位置从未稳固,领先优势从Gemini3被反超只用了两个月,从Anthropic ARR反超到遭遇瓶颈也只用了一个季度。 开源模型正在冲击闭源模型的定价根基:Anthropic和OpenAI旗舰模型越强越贵,客户越有动力找替代方案。企业客户开始用旗舰闭源处理复杂任务,用开源或低价模型(DeepSeek/MiniMax/Qwen)处理简单任务。开源正在吃掉90%的用量场景,闭源只能守住最难价的1%。 微软考虑用DeepSeek驱动Copilot Cowork:Nadella表示“我们最不愿看到的是,所有行业的每家公司都将价值拱手让给那些吞噬所见一切的少数模型”。微软不想被Anthropic和OpenAI绑架定价权。DeepSeek缓存命中输入价格降至0.025元/百万token,远低于同类模型,成本优势显著。 垂直AI应用公司正在从“闭源API+prompt engineering”转向“开源模型+自有训练能力+垂直场景优化”:Harvey用GLM-5.1训练出法律agent超越GPT-5.5和Opus 4.8;Cursor被xAI收购后获得自己的模型底座,从纯应用公司转型为应用+模型一体。 三波浪潮叠加推进:Vibe Coding已爆发,Vibe Working正在渗透,Vibe Creating还在实验期:Coding已是收获期(Anthropic和OpenAI收入主要来源),Working正在渗透(知识工作者占Codex用户20%且增速是程序员3倍),Creating还在实验期。演进逻辑是从高可验证性向低可验证性递进。 开源模型在artificial analysis榜单占据半壁江山,国产开源模型能力已从“能用”进入“好用”阶段。DeepSeek算法创新领先、成本优势显著;智谱GLM-5.x系列在coding上表现优秀;minimax m3在原生多模态有所突破。 多模态scaling潜力远未释放:Google Gemini 3核心突破在于原生多模态架构,DeepMind Omni被定义为世界模型。国内模型在文生视频输出上已领先——artificial analysis排行榜前十名有9个是中国模型。H2:Scaling Law没有失效——多模态、Multi-Agent、RSI是新方向。每隔一段时间,市场就会响起同样的质疑声:Scaling Law是不是见顶了?紧随而来的连锁反应总是相似的——担心AI是不是泡沫,是不是有更高效的方式,Transformer本身不是真正的理解而只是概率统计的游戏。然后模型能力又一次跃升,ARR又一次增长,这些怀疑暂时被搁置,但从未真正消失。这种周期性的怀疑背后,是两个更本质的问题:第一,什么是理解?第二,是否存在比暴力scale更高效的路径?关于第一个问题,压缩本身就是智能。当AI不仅在回答问题,还在真正地操作工具、修改代码、生成代码、生成报告、生成观点,当它能端到端地完成一个估值建模、能用300个子Agent并行协作13小时完成复杂编程任务、能在虚拟环境里“梦到”如何解鞋带然后在真实世界里做到——如果这些都不是理解,那什么是理解?关于第二个问题,确实有人在下不同的赌注。田渊栋、Yann LeCun、Ilya新成立的公司都在探索alternative架构和新的推理范式。但现实是:这些公司有理念、有融资、有顶级人才,却没有任何成型的模型或产品,没有DAU,没有ARR。投资人给钱更像是一种分散下注——万一Transformer真的不是终点呢?但这种bet的风险极高。相比之下,暴力美学至少还是有效的。Opus系列能力迭代放缓后,Fable再次跃升;GPT 5.1到5.4进步平缓,5.5和5.6又实现了质的突破。真正在发生的不是Scaling Law失效,而是单一维度的scaling遇到了边际收益递减,而多个新维度的scaling空间正在被打开。如果把“scale”理解为不只是堆更多参数,而是在更丰富的数据模态、更复杂的协作架构、更深度的自我进化、更强的世界理解上做scaling,那么我们离天花板还很远。多模态:从理解文字到理解世界。Google在2025年11月凭Gemini 3短暂领先,核心突破在于原生多模态架构,在预训练阶段就把视频、图像、音频、文本都映射到同一个向量空间里。DeepMind发布的Omni模型被定义为世界模型,既能理解世界,又能完成视觉创作。多模态scaling的潜力还远未释放。当前的视频生成模型和文本模型是两条技术路线。如果未来能实现真正的统一架构,一个模型既能读懂视频、生成视频,又能理解文本、写代码,那么不同模态之间的能力就能互相迁移。Multi-Agent:从单兵作战到军团协作。如果单个模型的能力增长在放缓,那么让多个Agent协作来完成复杂任务,就是另一个scaling维度。月之暗面的Kimi Work展示了一个极端案例:13小时连续编码、300个子Agent并行协作、4000多次自主工具调用。但Multi-Agent也面临工程挑战。第一是成本——300个Agent同时跑,token消耗是单Agent的几百倍。第二,Agent越多,系统行为越难预测。第三,一个Agent失败可能导致整个任务链崩溃,容错机制设计非常复杂。RSI:让AI自己训练AI。如果说Multi-Agent是空间上的scaling,那么RSI(Recursive Self-Improvement)就是时间上的scaling——让AI系统不断改进自己,形成正向循环。Anthropic在6月披露了几个关键数字:代码库里超过80%的代码由Claude写出;2026年Q1工程师人均每天合并的代码量是2025年之前的8倍;2026年4月有一个AI Agent端到端完成了一项AI安全研究,累计工作800小时,效果比人类研究员一周的成果还要好。AI写代码训练AI,训练出来的AI更强,更强的AI写更好的代码,更好的代码又训练出更强的AI。Anthropic设想了三种未来:第一种是模型能力不再变强;第二种是有复利效应但不会指数级增长(目前处于这个阶段);第三种是完全RSI,人类在训练流程中的角色大幅缩小。H2:Frontier model竞争格局——交替领先,终局未定。过去三四年,大模型第一的位置从未真正稳固过。2023到2024年OpenAI是话题的中心,2025年Google凭Gemini 3短暂领先,2026年初Anthropic靠coding反超,到现在OpenAI在模型能力上又追了回来。这种交替领先的格局背后,既有技术路线的分化(多模态vs编码专精vs通用智能),也有组织能力的差异(Google的大公司病vs Anthropic的专注vs OpenAI的资源优势),还有产品飞轮转速的竞赛。Google:从领先到掉队。Google凭借Gemini 2.5和3.0的发布“一雪前耻”。原生多模态架构、YouTube的海量视频数据和Waymo积累的物理世界交互数据,构成了OpenAI和Anthropic难以复制的结构性优势。但高光时刻只维持了两个月。2025年底到2026年初,Agentic+coding产品开始密集爆发,Claude Code迅速占领开发者社区。截至2026年5月15日,Anthropic的ARR达470亿美元,在绝对值和环比增速上都领先OpenAI。Google在这一轮coding军备竞赛中明显慢了半拍。问题在于战略选择——Google最初把主要精力放在基础模型上,忽视了coding RL。此外,Antigravity的用户体验不佳,用的人少就拿不到真实使用数据,没有数据RL训练就跟不上。Anthropic:从反超到遭遇瓶颈。Anthropic的领先优势在二季度开始出现裂缝。Opus 4.7相较于Opus 4.6没有明显改善;Fable上线后又被撤回,再度上线后“静默降智”——系统会把复杂任务偷偷降级到Opus 4.8的能力水平去完成。更底层的约束是:算力供给不足开始限制产品迭代速度。Anthropic不得不通过调整定价策略变相控制用量,不再允许第三方Harness按API价格使用Claude。OpenAI:抓住窗口期回归。OpenAI抓住了这个窗口期。5月发布的GPT 5.5和后续限量上线的GPT 5.6,让OpenAI在coding能力上追平甚至在某些任务上超过了Claude。OpenAI此前被诟病算力储备过多、资本开支失控,此时反而成了竞争优势。因为有充足算力,OpenAI可以用价格战去抢用户。H2:闭源vs开源——天平正在倾斜。闭源在前沿能力上仍领先6到12个月,但开源在性价比、可控性、数据隐私上的优势正在吸引越来越多的垂直AI应用公司自己训练模型。开源模型正在冲击闭源定价根基。Anthropic和OpenAI的旗舰模型越强越贵,客户就越有动力找替代方案。企业客户开始在复杂任务用旗舰闭源,简单任务用开源或低价模型。开源模型tokens消耗量大,但因为定价便宜,收入并没有同步高增。开源正在吃掉90%的用量场景,闭源只能守住最难价的1%,天花板被结构性压制。模型路由器是关键基础设施。客户提交一个任务,路由器自动判断复杂度,简单任务扔给DeepSeek(便宜),复杂任务扔给Fable 5(贵但准)。一年前全球大型企业基本上不会碰任何中国开源模型,担心安全漏洞。现在很多金融服务公司都在用,因为没发现安全问题的证据,而且确实能省钱。微软甚至考虑用DeepSeek来驱动Copilot Cowork。Nadella在Anthropic被禁之后发了一条X:“我们最不愿看到的是,所有行业的每家公司都将价值拱手让给那些吞噬所见一切的少数模型。”。开源模型会不会闭源?模型公司要赚钱、要回收数据飞轮。国产厂商想闭源(为了赚钱),但企业客户在推开源(为了省钱)。两个力量在反向对冲。最终结果取决于:模型的不可替代性溢价到底值多少。Anthropic和OpenAI现在面临的是跟英特尔当年一样的困境——高端芯片利润率很高,但份额被ARM一点点蚕食。最后英特尔守住了数据中心和高性能计算,但PC和移动市场全丢了。H2:模型在做应用,应用也在做模型。模型公司往下游延伸。Anthropic今年在产品层动作频繁——Claude Code直接杀进AI Coding赛道;Claude Design直接对标Figma,发布当天Figma股价跌7%。公司还在金融服务、法律、医疗、生命科学四个垂直领域发布了工程经理招聘。模型公司从卖token变成卖解决方案。API收入的天花板是推理量,垂直应用收入的天花板是企业愿意为解决方案付多少钱。应用公司往上游做模型。2026年4月底,SpaceX以600亿美元收购Cursor。6月17日,Cursor宣布自研1.5万亿参数的底座模型,背后用的是SpaceX的算力——超过10万张GPU。Cursor+SpaceX的优势在于:有自己的算力和模型底座、不被单一上游锁死。之前Cursor的致命问题是——供应商(Anthropic、OpenAI)同时也是竞争对手(Claude Code、Codex),现在这个结构性矛盾被解开了。Harvey的案例:开源模型+自有训练。6月22日,Harvey发布文章,通过与Applied Compute合作,在GLM-5.1基础上进行post-training,训练出在Harvey Legal Agent Benchmark上表现最强的法律agent模型。训练后的GLM-5.1在rubric pass rate上达到0.913,超过GPT-5.5和Opus 4.8。Harvey为什么要这么做?第一,数据隐私是刚需——法律文档涉及客户机密,发到OpenAI或Anthropic的API上客户不会接受。第二,减少对闭源模型的依赖——如果完全依赖OpenAI API,OpenAI随时可以调价、限流、甚至自己做法律agent产品跟Harvey竞争。垂直AI应用公司的长期生存策略是开源模型+自有训练能力+垂直场景优化,而不是闭源API+prompt engineering。后者的护城河太浅——任何竞争对手都可以调同样的API。H2:三波浪潮——从Vibe Coding到Vibe Working再到Vibe Creating。Vibe Coding:已经爆发的现实。Vibe Coding为什么能率先爆发?核心是可验证性。代码写出来能不能跑、过不过测试,有编译器给出yes or no。这让大模型厂商能用强化学习在RL阶段疯狂训练。但Vibe Coding的天花板也在隐约浮现。GitHub Copilot从固定月费改成按Token计费后,用户账单暴涨。企业开始从tokenmaxing转向精细化管理。Vibe Working:正在渗透的白领办公。OpenAI在2026年6月披露:知识工作者现在占Codex用户的20%,增速是程序员群体的3倍。AI Agent的风已经从程序员工位吹到了普通打工人的桌面。实际应用场景已经在跑通:金融行业的投研人员让AI调研近10年持仓数据、做估值建模、自动生成自选股复盘;市场人员让AI读取本地产品方案、生成市场分析报告;券商分析师用AI整理路演纪要。金融已经成为Anthropic第二大收入来源。但Vibe Working面临的摩擦力比Coding大得多。第一是可验证性不足——一份PPT好不好看,短期内没有客观验证标准。第二是合规审计的空白——企业最敏感的财务数据、HR数据放在本地,Agent要操作这些数据就涉及权限、审计、留痕、追溯,目前这套合规框架还是空白。Vibe Creating:值得期待的未来。如果Coding是替代程序员的脑力劳动,Working是替代白领的重复性工作,那么Creating瞄准的是人类最后的堡垒——创意本身。视频生成是Creating最成熟的子领域。可灵能生成电影级的表演,seedance迭代速度极快。但商业化规模和Coding相比还差几个数量级。原因在于抽卡率太低——输入同一个prompt重复生成十次,可能只有一次是能用的。从Vibe Coding到Vibe Working再到Vibe Creating,AI应用从高可验证性向低可验证性场景递进,速度取决于能否构建有效的reward。H2:投资建议与未来展望。下半年投资主线:OpenAI和Anthropic上市进展,Google能否翻盘,中国开源模型全球化。海外龙头上市窗口:OpenAI和Anthropic或在今年下半年到明年陆续上市。两家上市后会对整个板块形成定价锚点。Google的翻盘机会:Coding追赶能否重启产品飞轮,长期看多模态+世界模型布局。YouTube/Waymo数据和Omni架构是OpenAI和Anthropic没有的结构性优势。中国开源模型全球化机会:国产开源模型能力上已经快速追赶,从“能用”到“好用”。DeepSeek算法创新领先,成本优势显著;智谱GLM-5.x系列在coding上表现优秀;minimax m3在原生多模态有所突破。随着企业端从tokenmaxing转向开源节流,国产模型在全球市场的份额有望提升。延伸阅读:以上为报告核心趋势分析,如需获取完整报告详细数据及全部案例,请访问下载页下载完整PDF报告。FAQ区块(6组)。Q1:Scaling Law真的失效了吗?A:没有失效。真正发生的不是Scaling Law失效,而是单一维度的参数堆叠遇到了边际收益递减。多模态、Multi-Agent、RSI(递归自改进)、世界模型的scaling空间正在被打开。Q2:当前Frontier model的竞争格局如何?A:交替领先,终局未定。2025年11月Google凭Gemini 3短暂领先,2026年初Anthropic靠coding反超,Q2 OpenAI凭GPT 5.5/5.6回归。领先优势的半衰期正在急剧缩短。Q3:开源模型为什么在冲击闭源模型的定价?A:开源模型能力已从“能用”进入“好用”,且价格显著更低。企业客户开始用旗舰闭源处理复杂任务,用开源或低价模型处理简单任务。开源正在吃掉90%的用量场景。Q4:垂直AI应用公司为什么要自己做模型?A:两个原因:一是数据隐私是刚需——法律、金融等行业数据发到闭源API上客户不接受;二是减少对闭源模型的依赖——闭源厂商随时可以调价、限流,甚至自己做垂直应用竞争。Q5:AI应用的三波浪潮是什么?A:Vibe Coding(已爆发,高可验证性)、Vibe Working(正在渗透,中可验证性)、Vibe Creating(实验期,低可验证性)。演进逻辑是从高可验证性向低可验证性递进。Q6:中国开源模型的全球化机会在哪里?A:DeepSeek算法创新领先、成本优势显著;智谱GLM-5.x系列在coding上表现优秀;minimax m3在原生多模态有所突破。随着企业从tokenmaxing转向开源节流,国产模型全球份额有望提升。数据来源说明:本报告数据主要来源于东吴证券《大模型2026年中复盘及展望:诸侯混战,国模出海》(2026年7月7日),分析师张良卫(S0600516070001)、张文雨(S0600525070007)。部分数据来源于artificial analysis、Anthropic、OpenAI、Harvey等公开信息及东吴证券研究所整理。
【东吴证券】传媒行业深度报告:诸侯混战,国模出海——大模型2026年中复盘及展望-260707(19页).pdf_第1页
【东吴证券】传媒行业深度报告:诸侯混战,国模出海——大模型2026年中复盘及展望-260707(19页).pdf_第2页
【东吴证券】传媒行业深度报告:诸侯混战,国模出海——大模型2026年中复盘及展望-260707(19页).pdf_第3页
【东吴证券】传媒行业深度报告:诸侯混战,国模出海——大模型2026年中复盘及展望-260707(19页).pdf_第4页
【东吴证券】传媒行业深度报告:诸侯混战,国模出海——大模型2026年中复盘及展望-260707(19页).pdf_第5页

点击查看更多