回顾过去几年的人工智能发展史,我们不难发现一条清晰的演进脉络。从2020年GPT-3发布时的1750亿参数,到后来各家企业争相推出万亿参数甚至十万亿参数的大模型,"参数规模"一度成为衡量AI能力的唯一标准。那时候,每逢新模型发布,媒体和从业者最关心的问题就是:"这次有多少参数?"
然而,2026年6月的今天,这个标准正在被彻底颠覆。据CSDN《AI Launch Tracker》数据显示,过去一个月OpenAI、Anthropic、Google、DeepSeek、Meta、阿里等多家公司密集发布的模型更新,没有一家在强调参数规模。OpenAI在6月初低调推送了GPT-5的增量更新,在GPQA推理基准上从93.5提升到94.2,SWE-bench编码基准从95.0提升到96.1。没有发布会,没有直播,甚至没有官方博客——这种"安静迭代"本身就说明了一个变化:大模型的能力提升已经进入渐近线区域,单次更新的边际收益在递减。
大模型的竞争已经从"军备竞赛"转向"效率竞赛"。当各家基础能力趋于接近,谁能更好地落地应用、谁能让Agent真正跑起来,谁就掌握了下一阶段的主动权。这是整个产业走向成熟的标志。
所谓AI Agent(人工智能智能体),简单理解就是能够自主感知环境、做出决策并执行行动的AI系统。与传统"问答式"AI不同,Agent能够完成复杂的多步骤任务,如自动处理邮件、编写代码并调试、进行市场分析并生成报告等。
英伟达CEO黄仁勋在Computex 2026大会上明确表示:"AI产业正加速从'生成内容'迈向'主动执行任务'的智能体时代。"高通更是直接宣称"2026是AI Agent之年"。微软、谷歌、英伟达四家巨头不约而同押注智能体方向,标志着行业共识已经形成。
| 指标 | 传统大模型 | AI Agent |
|---|---|---|
| 交互方式 | 一问一答 | 自主规划执行 |
| 任务完成 | 单轮响应 | 多步骤链式 |
| 工具调用 | 不支持 | API/代码/搜索 |
| 适用场景 | 信息查询 | 复杂任务自动化 |
Anthropic的Claude Opus 4.8在6月获得功能更新,重点是Agent工具调用的可靠性提升。据Anthropic公布的内部测试数据,Opus 4.8在多步工具调用场景中的完成率从89%提升到95%,错误恢复能力提升了40%。这明确指向了Anthropic的战略重心:不是追求跑分最高,而是让模型在Agent场景中更可靠。
Google的Gemini 2.5 Pro则在多模态和长上下文上持续强化,6月更新后支持的原生多模态输入分辨率提升了3倍,上下文窗口从200万token扩展到300万token。这对于Agent场景中的文档理解和代码分析至关重要。
2026年6月的另一个重要趋势是MoE(混合专家)架构的全面普及。几乎所有主流大模型都在向MoE迁移——不是因为他们想做,而是因为不得不做。
原因在于成本。以GPT-5为例,其参数量据估计在2万亿级别,每次推理需要激活约3000亿参数。按照当前GPU计算成本,每百万token的推理成本约3-5美元。如果Agent场景中一个任务需要10-50次模型调用,单个任务的成本就在30-250美元之间——这对大多数企业应用来说是不可承受的。
| 架构类型 | 参数量 | 激活参数 | 成本降幅 |
|---|---|---|---|
| 传统Dense模型 | 1000亿 | 1000亿 | 基准 |
| MoE模型 | 2350亿 | 470亿 | 80%+ |
| 主流MoE平均 | 差异大 | 15-25% | 4-7倍 |
MoE架构通过"条件计算"解决了这个问题。模型被分成多个专家子网络,每次推理只激活与当前输入最相关的2-4个专家。DeepSeek V4 Pro就是典型案例——2350亿总参数,但推理时只激活约470亿参数,推理成本降低了80%以上,而能力损失不到3%。
DeepSeek V4 Pro在6月初宣布永久降价75%,API价格降至每百万token仅0.14元人民币。这是DeepSeek今年第二次大幅降价。激进的价格策略背后是对市场份额的争夺——在模型能力趋同的背景下,价格成为最直接的竞争武器。
大模型本身只是Agent生态的一个组件。连接模型与应用的中间层,才是决定Agent能否真正落地的关键。这个中间层目前有三股力量在竞争:
英伟达发布的Cosmos 3全模态物理AI模型,开源并成立"全球物理AI开发者协作联盟"。英伟达还推出Isaac GR00T人形机器人开发平台、DRIVE Hyperion自动驾驶出租车平台等。英伟达正从"GPU公司"转型为"AI全栈基础设施提供商",其生态控制力进一步增强。
OpenAI推出Dreaming V3记忆系统,实现自动后台记忆——会主动在后台分析用户对话,将重要信息合成到长期记忆中,无需用户显式指令。官方表示计算效率提升约5倍。OpenAI还正式宣告进军实体机器人赛道,组建"OpenAI Robotics"新团队。
Meta的Llama 4 Maverick、阿里的Qwen3-235B在6月都获得了社区的大量贡献——微调模型、Agent框架、行业适配器。开源模型的能力虽然还落后闭源半个身位,但生态的丰富度正在快速追赶。
短期内,三者各有优势:英伟达的硬件优势让它在推理性能和安全运行时上有天然壁垒;OpenAI的模型能力和开发者生态让它在应用层最灵活;开源框架则在定制化和成本上有优势。但长期看,这三者不是互斥的,而会形成一种分层协作的格局——英伟达做底层,OpenAI做模型,开源做连接。
6月4日,Anthropic在官方博客发布了一篇题为《当AI构建自身》的长文,首次罕见对外披露了一批此前从未公开的内部运营数据。这些数据显示,AI正在以惊人速度加速AI自身的开发进程:
更关键的是,Anthropic提出了一个令整个AI行业不安的概念警示:"递归自我改进"(recursive self-improvement)——即AI系统无需人类干预、自主设计并改进其继任者的能力。这一阶段尚未到来,但"可能在未来两年内发生,甚至更早"。
基于这些数据,Anthropic提出了一个在AI行业颇为罕见的主张:全球应协调考虑暂停或放缓前沿AI的开发。在业务高速扩张之际,Anthropic却主动呼吁"踩刹车"——这一反常举动,正在华尔街和硅谷同时引发争议。
在全球AI产业格局重塑的背景下,中国AI企业走出了一条独特的发展道路。
2026年2月,中国大模型总调用量领先优势持续扩大,全球总调用量达25.7万亿Token,中国占比近31%,美国仅14.6%。这意味着中国在大模型应用落地方面已经走在世界前列。
DeepSeek持续降价,中国模型"按厘计价"的极致性价比策略推动AI应用规模化临界点提前到来。这种策略在海外市场是难以想象的。
2026年Q1,百度、阿里、字节、智谱形成"四极"格局,各家企业不再盲目对标OpenAI,而是寻找差异化赛道。百度的文心、阿里的通义、字节的豆包、智谱的GLM,每个都有自己的特色和优势领域。
华强北AI眼镜成为市场顶流,AI眼镜首次被纳入国家补贴范围,深圳华强北的AI眼镜销量持续攀升,甚至成为海外游客"中国购"的热门单品。
综合6月的各项进展,我们可以做出一个基本判断:2026年下半年,AI Agent将迎来一个关键的能力跃迁点。
这个跃迁不是来自单一模型的能力突破,而是来自三个因素的叠加:
AI大模型竞争正在从"参数竞赛"转向"生态为王"。这个转变意味着:
对于散户投资者而言,这意味着与其关注模型的参数规模或跑分排名,不如关注哪些企业真正构建起了可持续的Agent应用生态。那些能够在应用落地、效率优化、生态建设上取得突破的企业,才是这场AI革命的真正赢家。