2025.8.26人工智能行业专题
- 本篇报告聚焦海内外模型发展,探究模型能力与应用的进展和边界。海外模型呈差异化发展,企业调用时注重性价比,OpenAI 在技术路径上相对领先,聚焦强化推理与专业领域能力,谷歌在端到端原生多模态领先,Anthropic 强调实用性且在编程场景领先,从模型 API 份额看,谷歌与 Anthropic 因价格优势份额较高;国内各家模型尚未拉开明显技术差距,需关注特定场景差异化能力。
- 随着模型能力提升,兴趣推荐成为 AI 赋能最显著场景,主要应用于广告和游戏行业。
- GPT3.5 发布近两年来,模型与应用在场景上开始出现竞争,报告通过五个典型案例,探讨不同场景下模型与应用企业的竞合关系。同时,报告提及了宏观经济波动、广告增长不及预期、行业竞争加剧、AI 技术进展不及预期等风险提示。
摘要
本篇报告聚焦海内外模型发展,探究模型能力与应用的进展和边界。海外模型呈差异化发展,企业调用时注重性价比,OpenAI 在技术路径上相对领先,聚焦强化推理与专业领域能力,谷歌在端到端原生多模态领先,Anthropic 强调实用性且在编程场景领先,从模型 API 份额看,谷歌与 Anthropic 因价格优势份额较高;国内各家模型尚未拉开明显技术差距,需关注特定场景差异化能力。
随着模型能力提升,兴趣推荐成为 AI 赋能最显著场景,主要应用于广告和游戏行业。广告领域,AI 通过多模态提升内容理解,进而提升用户点击率、观看广告时长,拉动广告价格和广告位增长,报告详细分析了 Meta、Reddit、腾讯和快手广告在 AI 技术应用上的进展;游戏领域,海外 AIGC 游戏平台 Roblox 借助 AI 升级推荐算法,让更多新游戏获得曝光,25Q1 平台 Top100 游戏中有 24 款是过去一年内推出的,11-50 名的游戏流水同比增长超 1 倍,占总流水增量的 40%。
GPT3.5 发布近两年来,模型与应用在场景上开始出现竞争,报告通过五个典型案例,探讨不同场景下模型与应用企业的竞合关系。同时,报告提及了宏观经济波动、广告增长不及预期、行业竞争加剧、AI 技术进展不及预期等风险提示。
一、海外大模型差异化发展,企业调用考虑性价比
(一)大模型份额变化:谷歌与 Anthropic 优势明显,国内模型稳健进步
根据 Openrouter 数据,谷歌与 Anthropic 模型占据模型调用市场半壁以上江山,两者持续迭代重磅模型版本,谷歌的 Gemini 1.5 与 Gemini2.0 系列在多模态、长文本领域优势显著,Anthropic 发布的 Claude 3.5\3.7\4.0 系列复杂推理编程能力突出。
国内方面,随着 Deepseek 推理开源 V3/R1 模型的发布,以开源为特点的模型在市场份额稳步提升,代表模型包括 Deepseek 系列、QWEN 系列、Kimi 系列。
(二)谷歌模型性价比显著,引领市场份额
从全球调用量领先的大模型参数来看,谷歌多款模型在价格上具备明显优势,如 Gemini 2.5 Flash 输入价格 0.30 美元 / 百万 Tokens,输出价格 2.50 美元 / 百万 Tokens,延迟 0.51 秒,且上下文支持 1.05M Tokens;Anthropic 的 Claude Sonnet 4 输入价格 3.00 美元 / 百万 Tokens,输出价格 15.00 美元 / 百万 Tokens,延迟 2.14 秒,上下文支持 200K Tokens;相比之下,OpenAI 的 GPT-4.1 输入价格 2.00 美元 / 百万 Tokens,输出价格 8.00 美元 / 百万 Tokens,延迟 0.46 秒,上下文支持 1.05M Tokens。此外,部分开源模型如 Mistral Nemo、Meta 的 Llama 系列等,在价格和可用平台上也各有特点,部分免费模型如 DeepSeek V3 0324、Kimi K2 等,在开源平台上可下载使用。
(三)海外大模型差异化发展
- OpenAI:技术路径仍领先,聚焦强化推理与专业领域能力,逐步提升性价比,但端到端多模态生成能力较谷歌偏弱。市场此前预期 GPT5 对各模态输入有极强原生理解并能转化为可执行指令 / 多模态输出,实际未实现。其 GPT-4.1 支持 100 万 token 上下文,编码能力显著提升(SWE-bench 得分 54.6%),多语言处理效率翻倍;GPT-5 集成 o 系列推理能力,低幻觉率、编码分析和拟人化能力强,支持标准版、mini 版和 nano 版 API,调用成本进一步下降。
- 谷歌:端到端原生多模态(视频、音频、文字)输入理解领先,输出仅文字,在 AIGC 尤其视频生成方向业内领先。Gemini 2.0 Flash/Pro 集成 Agent 架构,支持实时接收多种信息并推理反馈;Gemini 2.5 Flash/Pro 支持 10M token 超长上下文,推理效率提升,具备代码生成和多模态交互能力;Veo 3 基于文本和图像提示生成高质量视频,配备 V2A 技术实现音画同步,支持最高 4K 分辨率输出,具备物理效果模拟能力。
- Anthropic:强调实用性,在编程场景领先,高准确度带来高市场占有率,但通用性能与多模态能力相较头部模型稍弱。Claude 3.7 Sonnet 是市场上首个混合推理模型,可在普通回答和深度思考模式间切换,编码和前端开发能力突出;Claude Sonnet/Opus 中,Opus 4 支持连续 7 小时复杂推理任务,Sonnet 4 在 SWE-bench 编程测试中得分 72.7%。
- Meta(二梯队):Llama 4 Scout/Maverick 是多模态 MoE 模型,Scout 支持 1000 万 token 上下文,Maverick 以 402B 总参数超越 GPT-4o,支持图像理解和代码生成。
- xAI(三梯队):Grok 3 Beta 支持 131K token 上下文,数学推理(AIME 2025 得分 93.3%)和代码生成能力领先,集成 DeepSearch 实时数据抓取功能;Grok 4 分为标准版本和多代理版本,上下文窗口最高支持 256K tokens,号称 “世界上最强 AI 模型”,处理学术问题达博士级别。
(四)国内大模型近期进展
- DeepSeek(一梯队,自研能力强):技术研究领先,采用混合注意力机制、动态路由 MoE 等架构创新,降低计算复杂度和通信开销、提升数据利用率,在代码生成、数学计算等专业领域表现出色,主打开源、支持超 100 种语言。DeepSeek V3 0324 推理任务表现提高,在数学、代码类相关评测集上得分超过 GPT-4.5,中文写作、搜索等能力优化;R1 0528 基于 V3 架构,采用多头潜在注意力(MLA)和混合专家(MoE)技术,推理效率比传统架构提升 30%。
- 阿里(二梯队):自研能力与综合能力强,模型参数与种类丰富,Qwen3 包含 2 个 MOE 模型和 6 个 Dense 模型,0.6B-235B 参数版本,支持轻量化设备部署和复杂推理任务,开源基座模型适配多场景;Kimi K2 为 1 万亿参数,支持 128K token 上下文,代码生成(SWE-bench 得分 72.5)和 Agent 任务能力突出,API 定价低至 4 元 / 百万输入 tokens。
- 字节(二梯队):豆包大模型 1.6 在推理、数学、指令遵循、Agent 等能力有较大提升,首创按输入长度区间定价(0-32K 区间输入成本 0.8 元 / 百万 tokens),支持视频生成和企业级 Agent 开发,各模态表现较均衡,虽多数模态不领先,但总分较高。
- 百度(二梯队):文心大模型 4.5 是原生多模态推理模型,采用 FlashMask 动态注意力掩码和多模态异构专家技术,长文处理和多轮交互能力显著提升,在中文场景深度优化,长文本理解能力突出;文心大模型 4.5 Turbo 具备多模态、强推理、低成本三大特性。
- 腾讯(三梯队):混元 Turbo S 在 Chatbot Arena 排名全球前八,国内仅次于 DeepSeek,代码、数学等理科能力进入全球前十;混元 T1 基于 TurboS 快思考基座,扩展推理能力,全面搭建模型文理科能力,长文本信息捕捉能力强,且基于 DeepSeek 改造,自研投入较少。
二、兴趣推荐成为 AI 赋能最明显的场景
(一)推荐算法排序流程与广告平台的技术探索:均有收益且 ROI 显著
推荐算法主要包括内容召回、粗排、精排、优化排序四个环节。内容召回是从庞大资源库中挑选与用户潜在兴趣相关的内容,依赖多维度信息;粗排用简单模型快速评估内容潜在价值;精排运用复杂模型深入评估排序,提升准确性;优化排序则对列表进行最终调整,考虑多方面因素。
字节主要优化特征层,近一年用户停留时长提升 4%-5%,通过大模型提升对 user/item 的理解、依据《HLLM》论文强调 embedding 微调、发布 Rec Mix 实现更高密度特征交叉,相关技术已推广至 80-90% 流量;META 对特征与排序环节改进,一年用户时长与转化提升 10% 以上,通过 HSTU 论文优化特征层、Wukong 优化排序层、GEM 生成式广告推荐系统负责排序环节;快手对特征与粗排环节进行端到端优化,理论用户时长提升 6%,基于 OneRec 论文采用端到端编码器 - 解码器生成框架,引入基于奖励机制的偏好对齐方法,另有 Andromeda 架构、Lattice 算法。
(二)AI 对社交媒体广告推荐效果优于传统搜索
搜索和社交媒体推荐存在生产力代差,AI 对社交媒体广告推荐赋能更显著,抖音、快手、拼多多、小红书、腾讯视频号(AI 算法推荐为主)相比腾讯搜一搜、阿里、美团(偏搜索场景),长期 AI 赋能潜力更大。
原有产品的基线(baseline)决定 AI 改善幅度,如 META Reels、腾讯视频号产品发展较晚、广告基建弱于字节,利用 AI 先进算法提升显著。腾讯目前用大模型优化 embedding、结合微信视频号数据优化 embedding,后续还可进行特征交叉优化,仍有提升空间。
当下,生成式推荐的改进方向包括多模态提升内容理解、提升 Rank 精准度、生成式推荐新架构,但暂时没有公司能将内容理解模型做深,基本是 ID 类特征 + 内容理解或用多模态特征辅助训练,国内厂商正探索相关环节。
(三)兴趣推荐重要场景之广告:详解 Meta、Reddit、腾讯、快手广告技术进展
- Meta:AI 带动广告量价齐升连续七个季度AI 带动广告曝光量(Impression)增长:通过精准推荐、提升 AI 内容分发占比、完善数据标签体系,推动 Reels 用户时长增长,进而带动曝光量增长。2023 年 1 季度至 2025 年 2 季度,广告位 impression 同比增速多为正,25 年 1 季度、2 季度分别增长 20%、11%。AI 带动广告单价(CPM/Ad Price)增长:通过 Advantage + 工具提升广告主投放环节 20% ROI,通过精准投放匹配提升广告 CTR,2023 年 1 季度至 2025 年 2 季度,广告价 Ad Price 同比增速逐步改善,25 年 2 季度增长 10%。AI 版图:AI 在广告、内容体验、商业消息传递(WhatsApp)、Meta AI(搜索聊天助手)、AI 设备 (AI 眼镜) 五大领域有商业化潜力,核心 AI(广告)领域 ROI 回报强劲、可量化且测量体系成熟;GenAI 商业化先追求规模(覆盖数十亿用户)和产品质量,需数年再盈利。广告推荐方面,通过改进推荐算法与 Advantage + 提升广告量和价格;内容体验方面,AIGC 工具帮助广告主实现广告制作和投放自动化,24 年年化收入 200 亿美金;商业消息传递方面,WhatsApp 类似微信 + 企业微信,未来企业可通过商业 Agent 进行 AI 版私域营销,25Q2 月活用户超 10 亿;Meta AI 和 AI 设备目前先追求用户规模和产品质量,暂未变现。
- 谷歌:AI 带动广告转化率改善,广告收入稳健增长AI 对广告产品持续升级,提升广告主转化效率,新功能推出后通常能带来 20% 左右效率改善。24Q1 将 Gemini 功能引入 PMax 平台,使用 P-Max 素材生成功能的广告主发布优质广告可能性提高 63%,广告效力达卓越的广告主平均转化次数提高 6%;24Q2 扩展 AI 驱动的利润优化工具至 PMAX 广告和 shopping 广告,采用 ACA 功能的企业转化次数提高 5%,使用利润优化和智能出价的广告主平均利润提升 15%;24Q4 开放营销组合模型 Meridian,采用 PMax 至广泛匹配和智能出价的广告客户转化次数或价值平均提升 25% 以上,基于 AI 技术的 YouTube 视频广告系列 ROI 比手动广告系列高 17%;25Q1 在 Demand Gen 中,广告主可精准管理多平台广告投放,使用 Demand Gen 的企业在特定目标上每美元支出转化率同比增长 26%,与产品 Feed 结合时同比增长超 1 倍;25Q2 推出搜索广告的 AI MAX 功能,广告主通常获得 14% 转化率提升,推出智能出价探索,广告系列平均转化率提升 19%,推出 Asset Studio 帮助生成创意素材,目前超 200 万广告客户使用谷歌 AI 驱动资产生成工具投放广告,同比增长 50%。广告收入呈增长趋势,2023 年以来谷歌服务(广告业务)收入逐步增加,同比增速保持正增长。
- Reddit:AI 及非 AI 广告产品升级带动收入增长商业化起步较晚,近两年受益于广告产品完善及与谷歌合作带来的流量增长,广告收入大幅增加。非 AI 广告产品:动态产品广告(DPA,25Q2 上线),比标准转化广告系列平均高出两倍广告支出回报率;持续推动 CAPI 采用,24H2 和 25H1CAPI 覆盖的转化收入同比两倍增长,广告主采用 CAPI 和 Pixel 结合使用时,每次行动成本降低 25%。AI 广告产品:24 年推出标题生成器、审核系统等辅助功能及 AI 工具套件 Reddit Pro,收购 Memorable AI 优化创意;24Q1 使用 AI 缩短广告创建时间,推出 AI 驱动标题生成器;24Q2 收购 Memorable AI 优化广告创意;24Q3 为销售团队提供 AI 驱动工作流程;24Q4 推出 LLM 驱动广告审核系统,审核速度提高 70%,时间从 30 分钟缩至 1 分钟;25Q2 推出 AI 广告工具 Reddit Community Intelligence,包含 Reddit Insights(提供实时热门话题和品牌对话数据)和 Conversation Summary Add - ons(展示用户正面评论摘要,点击率比标准图片广告高 10% 以上)。
- 腾讯广告:AI 有望驱动增长保持较高增速,提升广告份额25H1,腾讯广告连续两个季度实现 20% 同比高增长,收入提升主要来自广告价格 CPM 的提升,原因包括 AI 部署带来的更高点击率,以及微信小店和小游戏带来的更完善闭环交易活动提升单次点击收入。增长驱动因素:流量上,AI 匹配精准使视频号和微信搜索流量持续增长,AI 原生应用场景也带来新流量;点击率上,AI 实现更精准定向投放,增加点击量;单次点击收入上,生成式 AI 创作广告素材及完善电商闭环交易,带来更多广告需求,且通过规模化基础模型升级广告平台架构,分析多维度数据和用户互动行为;广告加载率上,腾讯短视频广告加载率处于中低个位数百分比,同业普遍在 10%-15% 之间。技术进展:23 年起逐步提升 GPU 在广告推荐系统中的应用比例,GPU 优势体现在提高序列长度、推荐精准度和运算速度;24 年中上线广告 3.0 系统,新广告投放已覆盖 95% 广告投放,助力行业大盘整体投放稳定性提升 26%,达成率提升 8.7%,起量率提升 207%。
- 快手广告:AI 提升广告点击率和转化率带来线上营销服务低单位数增长今年广告收入增长主要驱动是 CPM 提升,Adload 在流量大盘增长基础上逐步释放提升。AI 赋能广告环节:素材生产方面,一站式视频创意生产平台通过多模态大模型学习理解海量素材,生成优质营销素材,25Q1AIGC 营销素材日均消耗约 3000 万人民币,可灵(AI 视频工具)25Q2 收入 2.5 亿元,70% 来自 P 端 / 海外用户,客户可定制视频脚本与画面,实现精准广告创意生产且成本降低;外循环智能投放产品 UAX 基于大模型推理广告潜在受众,评估素材跑量能力并自动调整投放策略;内循环全站推广 Agent4.0 的出价及调价能力,实现商业化流量和电商流量一体化,帮助商家获取更多自然流量。推荐技术:OneRec 推荐算法当前应用于用户流量,未来可作用于广告,新推荐系统从传统多阶段模式变为端到端一站式分析,抓取用户一年以前长尾观看习惯,避免传统算法稀疏性问题,已带来用户时长和留存率提升。OneRec 广告推荐系统采用端到端统一生成架构,底层共享 embedding,广告塔 + 内容塔多任务输出,共享表征层减少冗余,单一架构统一训练与推理,运营成本仅为传统推荐流程的 10.6%。