我的歌单

写给她的 AI 发展史:从 Transformer、ChatGPT 到 MCP、Skills 与 Agent 时代

发表于
更新于
字数: 1.1k
时长: 25m
阅读: -
玉门

引言:写给想弄懂 AI 的她,也写给你

这篇文章的起因其实很生活化:她想了解 AI,问我现在大家天天说的 GPT、Agent、MCP、Skills、A2A、文生图、文生视频各种模型、各种名词到底是什么。

我想了想,如果只是丢给她一串名词、论文和产品链接,估计只会越看越晕;但如果从“这轮 AI 为什么突然火起来”开始讲,也许就能把很多看似零散的技术和产品串成一条线。

所以这不是一篇只写给工程师看的模型报告,而是一篇尽量用普通人也能顺着读下来的 AI 发展史。我们会从 2017 年的 Transformer 架构说起,看到 2020 年 GPT-3 把“大模型 + 提示词”推到台前,再到 InstructGPT、GPT-3.5 和 ChatGPT 让 AI 从实验室能力变成日常产品。

你是否还记得初次体验 ChatGPT 时的场景?彼时大家热衷于让它写两首打油诗、润色一段周报,或者扮演某种角色陪自己聊天。那时的 AI,就像坐在茶馆里嗑瓜子吹牛的相声演员——口齿伶俐、知识广博,但如果你让它真正操作电脑、查询业务系统或交付一份文件,它往往只能表示“我只是一个语言模型”

短短几年后,AI 不仅获得了视觉、语音等多模态能力,也通过 Tool Calling、MCP 和 Agent 运行时接上了软件工具与外部数据。

今天的前沿 AI 产品,正在从单纯的**“聊天答疑框”**走向能够规划、调用工具、检查结果并交付产物的 Agent(智能体)。不过,“自主”并不等于完全可靠:权限边界、确认机制、可观测性与人工复核仍然是生产系统的重要组成部分。

本文想做的事,就是把这些变化按时间和用途讲清楚:AI 是怎么从 Transformer、GPT-3、ChatGPT 一路走到今天的 Agent 时代;文本、代码、图像、视频、音频这些“AI 时代的产物”分别经历了什么突破;以及 MCP、Agent Skills、Agent2Agent(A2A)这些新协议和新工具,为什么会在这一阶段集中出现。

有些概念一句话就能先抓住,比如 TokenPromptTool Calling;有些概念则值得单独写一篇,比如 TransformerRLHFRAGDiffusionMCPAgent 工作流。本文会先给出“地图”,让你知道每个词大概站在哪里;至于每个山头怎么爬,我们后面再一座一座慢慢拆。

本文按可公开核验的一手资料改写;模型与产品迭代很快,具体型号、上下文长度、价格和可用地区应以链接到的官方页面为准。


历史时间线:AI 的“炼丹与觉醒”史

在展开技术细节之前,我们先梳理一条可由论文与厂商发布记录交叉验证的时间线:

1956 AI 这个名字登场:达特茅斯会议 1956 年夏天,达特茅斯会议把 “Artificial Intelligence” 作为研究方向正式推到学术舞台。早期 AI 更偏符号推理、搜索、专家系统和规则工程,离今天的生成式 AI 还很远,但“让机器表现出智能”的问题从这里开始被系统讨论。
2012 深度学习破圈:AlexNet 与神经网络复兴 AlexNet 在 ImageNet 竞赛中大幅刷新图像识别效果,让 GPU 训练的大规模神经网络重新成为主线。今天的生成式 AI 不是直接从 AlexNet 变来的,但它证明了“数据 + 算力 + 深度模型”这条路线的威力。
2014 生成式路线升温:GAN Generative Adversarial Networks 提出生成器与判别器互相博弈的训练方式,推动了早期高质量图像生成研究。后来扩散模型、Transformer 与多模态模型接过主舞台,但 GAN 是理解“机器生成内容”历史时绕不开的一站。
2017-06 架构奠基:《Attention Is All You Need》 Google 研究团队发表论文,提出 Transformer 架构。它以 Self-Attention(自注意力)为核心,显著提高了序列模型的并行训练能力,后来成为大语言模型及许多多模态模型的基础。
2020-05/06 规模化预训练:GPT-3 与上下文学习 GPT-3 论文描述了一个 1750 亿参数的自回归语言模型,并系统展示了 Few-shot / In-Context Learning。它推动了“大规模预训练 + 提示词适配”的路线,但“涌现”究竟如何定义和测量,学界至今仍在讨论。
2022-11 现象级破圈:ChatGPT 与 RLHF ChatGPT 发布,其训练采用监督微调与 RLHF(基于人类反馈的强化学习)。RLHF 并非在 ChatGPT 上首次出现——OpenAI 更早的 InstructGPT 已系统使用这一方法——但 ChatGPT 让指令跟随式大模型真正进入大众视野。对齐训练改善了可用性,却没有消除幻觉。
2023-03/06 多模态与工具调用:GPT-4 & Function Calling GPT-4展示了图像与文本输入能力;同年 6 月,OpenAI 在 API 中加入 Function Calling,让模型可以生成符合给定函数模式的参数。LLM 因而更容易连接外部系统,但真正执行工具、管理权限和处理错误仍由应用层负责。
2024-02/09/11 视频、推理与协议:Sora、o1 与 MCP Sora 于 2 月公开研究成果;OpenAI o1 于 9 月把更多推理计算放到回答前;Anthropic 于 11 月发布 Model Context Protocol,为 AI 应用连接数据与工具提供开放协议。
2025-01/04 推理模型与 Agent 互操作:DeepSeek-R1 & A2A DeepSeek-R1 于 1 月发布,展示了以强化学习训练推理模型的开放路线;4 月,Google 发布 Agent2Agent(A2A)协议,并于 6 月将项目捐赠给 Linux Foundation。
2025-10/12 Agent Skills:把经验打包给 Agent Anthropic 发布 Agent Skills,把文档处理、品牌规范、团队 SOP 等能力打包成可按需加载的 Skill;随后 Agent Skills 作为开放格式推进,规范把 SKILL.md、脚本、参考资料和资源目录变成可复用的操作知识包。
2025-2026 Agent 基础设施进入开放协作阶段 MCP、A2A、Agent Skills、编码 Agent 与桌面/云端 Agent 工具链快速扩散。行业的重点不再只是“模型能生成什么”,而是模型如何安全地连接工具、读取上下文、交付文件、协同远程 Agent,并让执行过程可观察、可验证、可接管。

先认识几个关键词

如果第一次看这些名词,先不必急着把每个机制都吃透。下面这张表只是“地图路标”:用最通俗的话带你快速理解它们到底是什么,点击名称可跳转深入阅读。

概念(点击链接查看详情文章)一句话看懂
TokenAI 吃进和吐出文字的“乐高积木块”,汉字或单词会被切成这样一个个基本碎片来计算。
Prompt你给 AI 下达的“需求指令”,包括背景、要求和约束,决定了它扮演什么角色、交出什么结果。
LLM / GPT读遍全网文章的“超级接话高手”,本质是通过上下文预测“下一个词最可能顺着说什么”。
Transformer现代 AI 的“引擎底座”,让模型在看长长一篇文章时,能像人一样精准抓住上下文关键词之间的联系。
Few-shot / In-Context Learning“照葫芦画瓢”——不用重新训练 AI,只要在提问时给它两三个范例,它就能临时学会新格式。
RLHFAI 的“人类导师调教”,由人类对 AI 的回答打分和引导,让它说话更符合人类习惯、更听话安全。
RAG“开卷考试”——让 AI 在回答前先去搜你的私有文件或最新数据库,避免纯靠记忆瞎编乱造。
DiffusionAI 画画的“雕刻法”——先生成一团乱七八糟的噪点沙子,再一步步把清晰的图像画面“抹”出来。
Tool CallingAI 的“伸手拿工具”能力,知道遇到算术或查最新天气时,主动喊计算器、搜索接口或 API 帮忙。
Agent从“只会陪聊的对话框”升级为“能办事的数字员工”,会自己规划步骤、查资料、用工具并交付成果。
MCPAI 世界的“通用插头 (USB)”,让任意 AI 应用都能以统一标准轻松连接外部数据、软件和工具。
Skills给 Agent 准备的“工作 SOP 说明书”,把团队经验、操作步骤和代码脚本打包,供 Agent 随时翻阅学习。
A2A不同 Agent 之间的“跨公司对讲机”,让查数据的 AI、写代码的 AI 和做设计的 AI 能够跨平台分工协作。

如果只想快速补基础,可以先读这篇:AI 基础术语速查:Token、Prompt、Few-shot 与 Tool Calling


生成式 AI 主要模态:代表产品与突破方向

如果把基础模型比作硅基大脑,那么文本、代码、图像、视频、音频就是它感知与表达世界的主要通道。严格说,代码也是文本的一种,但它需要运行、调试、测试和交付,所以值得单独拎出来讲。除此之外,3D/空间场景、文档/表格/UI 自动化也正在成为复合模态的重要方向。

下面列出的产品不是绝对排名;不同模型在质量、速度、成本、可控性、开放程度和部署方式上各有取舍。

graph TD
    AI["生成式 AI 主要模态"] --> Text["文本 / LLM"]
    AI --> Code["代码 / Coding Agent"]
    AI --> Image["图像 / Image Gen"]
    AI --> Video["视频 / Video Gen"]
    AI --> Audio["音频 / Speech & Music"]
    AI --> Scene["3D / 空间场景"]
 
    Text --> T_MoE["MoE 与稀疏激活"]
    Text --> T_RL["推理时计算与强化学习"]
    Code --> C_Tools["仓库上下文与工具执行"]
    Code --> C_Tests["测试、审查与交付"]
 
    Image --> I_DiT["Diffusion Transformer"]
    Image --> I_Flow["Flow Matching / Rectified Flow"]
 
    Video --> V_Patch["时空联合建模"]
    Video --> V_Control["一致性与可控编辑"]
 
    Audio --> A_Codec["神经音频编解码器"]
    Audio --> A_Diff["自回归 / 扩散 / Flow"]
    Scene --> S_3D["3D 资产、世界模型与仿真"]
TAB分类
💡 点击标签可切换下方对比内容
视图分类:

1. 文本 / LLM

大语言模型仍是 Agent 的核心推理引擎。近两年,竞争重点已经从单纯扩大参数量,转向推理时计算、长上下文管理、工具调用、计算效率与长任务稳定性

代表厂商、产品线与主要作用

模型和产品更新很快,下面更像一张“认识地图”,不是永久榜单。具体可用模型、上下文长度、价格、地区和套餐应以官方页面为准。

厂商 / 生态代表模型与产品主要作用备注
OpenAIChatGPTOpenAI APICodexSoraGPT Image 2、Realtime / Speech通用对话、推理、编程、图像、视频、语音与 Agent 任务ChatGPT 是产品入口,API 是开发入口,Codex 偏软件工程,Sora 偏视频创作,GPT Image 2 偏图像生成与编辑
AnthropicClaudeClaude CodeMCPAgent Skills长文档理解、编码、企业知识工作、工具连接与可复用操作知识Claude Code 与 Skills 让 Claude 更像能进入工作流的协作者
GoogleGeminiVeoImagenNano Banana 2 / ProFlowGemini Code Assist / Jules多模态模型、长上下文、视频、图像、开发者工具与 Workspace 生态Nano Banana 是 Gemini 原生图像生成能力的名称,包含速度、通用和专业资产生产等不同型号
DeepSeekDeepSeek-R1、DeepSeek-V 系列、DeepSeek API推理模型、高性价比 API、开放权重生态R1 让强化学习训练推理模型的开放路线受到广泛关注
Alibaba QwenQwen 通用模型、Qwen-Coder、Qwen-VL、Qwen-Image、Wan / 通义万相、阿里云 Model Studio通用对话、代码、多模态、图像、视频与企业 APIQwen 生态覆盖开源/开放权重与云端商业模型,许可证要逐个型号看
Meta LlamaLlama、Llama 多模态与开放权重模型本地部署、研究、企业私有化与开放权重生态更准确说是 open-weight,不应简单等同于传统开源
xAIGrok、Grok API、X 平台能力实时信息、对话、编码与 X 生态结合产品节奏与 X 平台绑定较深
国内长上下文 / Agent 生态Moonshot KimiZ.ai / GLM、MiniMax、百川、阶跃星辰等长上下文、办公问答、多模态、企业 API 与 Agent 应用国内模型入口、备案、地区、价格和开放权重状态变化较快,选型时要查模型卡

核心技术突破方向

💡 突破 1:MoE 稀疏激活与更高效的注意力

Mixture of Experts(MoE) 让每个 Token 只激活一部分专家参数,从而在扩大总容量的同时控制单次推理成本。DeepSeek、Qwen、Llama 等生态都出现过 MoE 或稀疏激活路线,但具体参数、激活规模与许可证需要看各自模型卡。

长上下文效率不能全部归因于 MLA(Multi-Head Latent Attention):MLA 是 DeepSeek 系列论文中的代表性设计之一,但不同厂商还会使用滑动窗口、稀疏注意力、KV Cache 压缩、上下文压缩和检索式记忆等不同路径,不存在一种已经统一全行业的方案。

ℹ️ 突破 2:Test-Time Scaling 与强化学习

行业正在把更多计算预算放到推理阶段:模型可以根据任务难度选择更高的 reasoning effort、调用工具、验证中间结果或并行探索。DeepSeek-R1 使用的 GRPO(Group Relative Policy Optimization) 是一条重要路线,但并非所有推理模型都使用 GRPO,也不能把整个行业概括为“纯强化学习”。预训练、监督微调、偏好优化、可验证奖励和推理时搜索仍会组合使用。

📝 突破 3:Hybrid Reasoning 与长任务上下文管理

GPT、Claude、Gemini、DeepSeek、Qwen 等产品线都在速度、成本和推理强度之间提供不同取舍。对长任务而言,真正的瓶颈也不只是模型标称 Context Window,还包括 KV Cache、上下文压缩、工具结果筛选、状态持久化与失败恢复。标称长上下文并不自动等于在整个窗口内同样可靠。

2. 代码 / Agent

代码也是文本,但它和普通写作不一样:代码可以运行、测试、报错、回滚,也会直接改动真实项目。因此,代码生成很快从“自动补全几行函数”进化到“理解仓库、修改文件、运行测试、解释失败、提交补丁”的编码 Agent。

工具 / 产品主要用途适合场景
OpenAI Codex面向软件工程任务的云端/本地编码 Agent修 bug、写功能、跑测试、代码审查、生成 PR
Claude CodeAnthropic 的命令行/IDE 编码 Agent大仓库理解、重构、测试驱动修改、长任务协作
CursorAI 原生代码编辑器日常开发、上下文问答、代码编辑、Agent 模式
WindsurfAI IDE 与 Cascade 工作流项目级修改、多文件编辑、开发流程自动化
Cline / Roo Code开源/社区型编码 Agent本地工具调用、可插拔模型、个人自动化
Gemini Code Assist / JulesGoogle 开发者 AI 工具Google Cloud、代码解释、代码审查与任务委派
OpenHands / Devin更偏自主软件工程 Agent从 issue 到实现、测试、调试的长链路任务

编码 Agent 的关键不是“会不会写代码”,而是能否可靠地使用工程反馈:类型检查、单元测试、lint、构建日志、浏览器验证、代码评审和版本控制。越接近真实交付,越需要明确权限、分支策略、测试边界和人工确认。

3. 图像生成

手指、文字和多角色一致性仍可能出错,但主流生图产品已经从“输入一句提示词、抽一张图”走向参考图控制、局部编辑、多轮修改和品牌资产一致性。

开源 / 开放权重代表 (Open-Weight & Ecosystem)

产品 / 模型开放属性核心特色与优势画质与审美可控与文字综合推荐
FLUX开放权重 (Dev/Schnell)基于 DiT + Flow Matching,具备惊人的解像细节与文字渲染能力⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Z-Image开源/开放权重阿里通义团队开源,单流 S3-DiT 架构与 Turbo 极速推理,中英双语文字精细度极高⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Stable Diffusion开源/开放权重生态拥有最庞大的 ControlNet、LoRA 插件库与 ComfyUI 节点式工作流⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Qwen-Image开放权重擅长中英文双语 Prompt 深度理解与本土图文生成⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐

闭源 / 商业服务代表 (Proprietary & Enterprise)

产品 / 模型服务形态核心特色与优势画质与审美可控与文字综合推荐
Midjourney商业 Web/Discord业界顶级的艺术感、构图审美与出片成功率,使用门槛低⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Krea AI商业 Web UI / 创意套件主打 Realtime Canvas(实时画布生成)、草绘涂鸦即时渲染与 AI 细节增强⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Google Gemini 图像能力原生 API / ChatNano Banana 2 / Pro 具备原生多模态图文交织、精确文字排版与局部编辑⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
OpenAI Images APIAPI / ChatGPTGPT Image 2 具备极强的自然语言复杂指令遵循与多轮对话编辑能力⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
IdeogramWeb UI / API专注于海报设计、复杂文字排版与矢量风格图像生成⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Adobe Firefly创意云套件 / API商业无版权风险承诺,深度集成于 Photoshop / Illustrator 等工作流⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
  • 核心技术变化
    • 从 GAN 到 Latent Diffusion,再到 Diffusion Transformer 与 Flow Matching:GAN 擅长快速生成,但训练稳定性与覆盖范围受限;Latent Diffusion 把去噪过程移到压缩后的潜空间,显著降低计算量;DiT 则用 Transformer 处理图像/潜变量 Patch。FLUX 系列与 Z-Image 采用基于 Flow Matching / Rectified Flow 的 Transformer 路线。
    • Flow Matching 不是“文字一定拼对”的单一原因:它学习把简单分布运输到数据分布的连续向量场,可能带来更直接的采样路径;但提示词理解、图中文字、角色一致性与编辑能力还取决于文本编码器、数据、架构、后训练和推理策略。
    • 从“一次性抽卡”走向多模态局部编辑与角色/品牌资产一致性(Character & Style Consistency):通过参考图输入(Image-to-Image)、局部重绘(Inpainting)、ControlNet 姿态控制与原生多模态指令编辑,生图已全面从单纯画图跨越到可控商业设计与品牌资产交付。
    • “开放”需要看具体型号与许可证:同一模型家族可能同时包含开放权重、非商业许可证和纯 API 版本。把整个 FLUX 或 Stable Diffusion 生态一概称为“开源”并不严谨。

4. 视频生成

视频生成需要同时处理画面质量、跨帧一致性、运动、镜头语言与音画关系,计算和数据成本通常高于单张图像。

开源 / 开放权重代表 (Open-Weight & Ecosystem)

产品 / 模型开放属性核心特色与优势画质与审美运动与一致性综合推荐
Wan2.1 / 通义万相开源/开放权重阿里开源视频大模型,具备极高的解像细腻度、物理仿真与强大镜头动态⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Hunyuan-Video开源/开放权重腾讯开源 8.3B 级 3D-DiT 架构,专注于影视级视觉质量与高真实度物理运动⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
NVIDIA Cosmos开源/开放权重英伟达开放全模态世界基座模型,面向 Physical AI、机器人与物理世界仿真⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
LTX-Video开源/开放权重Lightricks 打造的极速生成模型,独创单次 Diffusion 过程同时同步生成音视频⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Mochi 1开源/开放权重Genmo 开源 10B DiT 视频大模型,擅长超流畅流体运动与物理交互⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
CogVideoX开源/开放权重智谱 AI 开源视频生成生态,支持 3D VAE 架构与丰富社区微调扩展⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐

闭源 / 商业服务代表 (Proprietary & Enterprise)

产品 / 模型服务形态核心特色与优势画质与审美运动与一致性综合推荐
Seedance 2.0 (字节跳动 / 即梦)商业 Web / API字节旗舰多模态音视频大模型,支持文/图/音/视 4 模态资产输入、原生音画同步与多镜头叙事⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Sora商业 Web / APIOpenAI 的标杆性视频生成产品,基于时空 Patch 展现了“世界模拟器”潜力⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Google Veo商业 API / Labs支持 4K 高清生成、复杂运镜与自然语言控制,结合原生音画同步能力⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Kling AI (快手可灵)商业 Web / API卓越的长动作生成能力、首尾帧精确控制与高角色动作连贯性⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Runway Gen-3商业创意平台影视级控制工具链(Motion Brush 动态笔刷、摄像机运镜控制)⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Luma Dream Machine商业 Web / API极速推理响应、强视觉冲击力与影视摄像机运镜跟踪⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Hailuo AI (MiniMax 海螺)商业 Web / API人物复杂动态极其自然流畅,擅长高难度物理碰撞与自然场景⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Pika 2.0商业 Web / API独创丰富微观特效(Pika Swaps / Effects)、物理揉捏变形与多样化风格转换⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
  • 核心技术变化
    • Sora 是重要里程碑,但不是唯一标杆:OpenAI 的 Sora 技术报告提出了把视频生成模型作为“世界模拟器”方向扩展的研究视角;之后,Veo、Seedance 2.0、Kling、Runway 等产品也在镜头控制、一致性和生产工作流上持续推进。
    • Spatio-Temporal Patches(时空 Patch):Sora 的技术报告把不同分辨率、画幅和时长的视频压缩到潜空间,再切分为时空 Patch 供 Transformer 处理。这种联合建模有助于学习跨帧关系。早期视频生成也并不全是简单“逐帧生成 + 插帧”,不同系统路线差异很大。
    • 原生音视频联合建模(Joint Audio-Video Generation)与多模态资产输入:最新的技术突破(如 Seedance 2.0、LTX-Video、Veo 2)打破了以往“先生成无声视频再单独配音”的分离模式,实现单次 Diffusion Pass 原生同步生成音视频,并支持文本、图片、音频、参考视频等多模态资产联合控制。
    • 多镜头连贯叙事与主体锁死(Multi-Shot Consistency):视频生成正从“单镜头几秒动作表现”升级为“跨镜头场景切换、镜头组切与多视角统一的主体/角色绝对一致”,使 AI 能够直接参与短片级剧本分镜与视觉预演。
    • “世界模拟器”仍是研究愿景:OpenAI 的 Sora 报告与 NVIDIA Cosmos 均认为扩大视频生成模型是通向物理世界模拟器的一条有希望的路径;这不等于模型已经可靠掌握真实物理定律。

5. 语音音频

音频赛道至少包含音乐生成、文本转语音(TTS)、语音识别(ASR)、声音克隆与实时语音对话,不能把它们全部视为同一种任务。

开源 / 开放权重代表 (Open-Weight & Ecosystem)

产品 / 模型开放属性核心特色与优势音质与逼真度控制力与表达综合推荐
CosyVoice 2开源/开放权重 (Apache-2.0)阿里开源语音大模型标杆,支持零样本声线克隆、跨语言情绪调控与极低延迟流式输出⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Fish-Speech开放权重 (研究开源)基于 Dual-AR 架构,具备 SOTA 级超自然表达力与精准情绪/语气标记控制⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
ChatTTS开放权重 (非商业)专注于对话场景,擅长拟真笑声、自然停顿与语气词呼吸感⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Kokoro开源 (Apache-2.0)82M 参数极轻量 CPU 本地超快 TTS 模型,极为适合边缘设备与本地小工具⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Whisper-large-v3开源/开放权重OpenAI 开放权重 ASR 语音识别标杆(注:负责听觉转录而非语音生成)⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐

闭源 / 商业服务代表 (Proprietary & Enterprise)

产品 / 模型服务形态核心特色与优势画质与审美控制力与表达综合推荐
Suno (v4)商业 Web / APIAI 音乐现象级产品,从 Prompt 自动化生成作词、演唱、编曲与全轨混音⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
ElevenLabs商业 API / Web业界顶级多语言高保真 TTS、实时声线克隆、情绪配音与 Voice API⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
OpenAI Realtime API商业 API / Voice Mode端到端原生双向实时语音大模型,具备极低打断延时与极佳语气对话体验⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
Udio商业 Web / API专业级高画质音乐生成,支持音轨延展、乐器分轨控制与精细化创作⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
MiniMax 海螺 Audio商业 API / Web国内高逼真度 TTS 领域代表,极佳的人声质感、口音与情绪声线克隆⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
  • 核心技术变化
    • Neural Audio Codec(神经音频编解码器)与音频 Token 化:通过 SoundStreamEnCodec 或 DAC 等离散编解码器将连续波形压缩为音频 Token,大语言模型得以像预测文字一样预测音频 Token。
    • 从串行流水线走向原生端到端实时语音(Native Realtime Speech):传统“ASR 听写 ➔ LLM 思考 ➔ TTS 发声”的拼接流水线正被原生双向语音模型(如 OpenAI Realtime API、Gemini Live)取代,彻底消除了中转延时与情绪声调丢失。
    • 自回归、Diffusion 与 Flow Matching 的多线路结合:现代语音与音乐系统不仅依靠自回归架构,还会组合 Flow Matching、声学模型与声码器,以同时满足长音乐结构与毫秒级语音输出的要求。
    • 版权与身份保护重于技术本身:声音克隆和 AI 音乐涉及极高的身份冒用、版权法律与表演者权益风险,生产级应用高度依赖水印(Watermarking)与合法授权机制。

6. 3D与复合模态

除了文本、代码、图像、视频和音频,还有几类方向正在变得重要:

  • 3D / 空间内容:从文本或图片生成 3D 资产、场景、材质和动作,服务游戏、美术、仿真、AR/VR 与机器人训练。
  • 文档 / 表格 / PPT:不是只生成一段话,而是理解版式、数据、图表和模板,最后交付可编辑文件。
  • UI / Computer Use:通过浏览器、截图、鼠标键盘或系统 API 操作软件界面,完成订票、录入、配置、测试等任务。
  • 多模态理解与生成闭环:模型同时读图、听音频、看视频、写代码、调用工具,再把结果转回文件、网页、图片或语音。

这些方向通常不是单一模型单独完成,而是基础模型、工具调用、检索、渲染器、浏览器、文件格式解析器和 Agent 控制循环一起配合。 :::


连接“孤岛 AI”:MCP、Agent Skills 与 A2A

模型本身不会天然获得你的文件、数据库、浏览器或企业系统权限。要让 Agent 真正工作,应用需要解决三类不同问题:如何连接工具与上下文、如何复用操作知识、以及不同 Agent 如何互操作。MCP、Agent Skills 和 A2A 分别覆盖这三类问题的一部分,它们不是相互替代的同一种技术。

graph LR
    Host["AI Host / Agent"] -->|MCP Client| MCP1["MCP Server: GitHub"]
    Host -->|MCP Client| MCP2["MCP Server: Database"]
    Host -->|按需加载| Skill["Agent Skill: SKILL.md + resources"]
    Host <-->|A2A| Remote["Remote Agent / A2A Server"]

1. MCP(Model Context Protocol,模型上下文协议)

ℹ️ MCP 的价值:统一 AI 应用与外部能力之间的接口

在 MCP 出现之前,不同 AI 应用通常各自定义工具、数据源与提示模板的集成方式,重复适配很常见。MCP 提供统一的客户端—服务器协议,常被类比为 AI 应用的 USB-C。

这个类比表达的是降低重复集成成本,不是数学保证:真实系统仍要处理认证、权限、Schema 差异、网络传输、版本兼容和安全策略,不能简单断言所有场景都从 N×MN \times M 精确降为 N+MN + M

MCP 架构中,一个 Host(如 IDE 或桌面 Agent)可以运行一个或多个 MCP Client,每个 Client 与 MCP Server 建立连接。Server 可以公开三类主要的服务器原语:

  1. Tools:可由模型发现和调用的操作,例如查询 API、写入工单或执行受控命令。
  2. Resources:由应用读取并提供给模型的上下文数据,例如文件、数据库记录或文档。
  3. Prompts:由服务器提供、通常由用户显式选择的提示模板或工作流入口。

规范还包含 sampling、elicitation、roots、logging 等客户端能力和实用功能,所以把 MCP 永久概括为“只有三项功能”也不完整。MCP 统一的是通信与能力发现方式,并不会自动让任意 Server 变得可信;Client 仍需显示权限、确认高风险调用、保护凭据,并防范提示注入和恶意工具描述。

MCP 最初由 Anthropic 发布,并在多个模型厂商、IDE、桌面 Agent 和开发工具中快速扩散。关于治理归属和最新规范版本,应以 MCP 官方站点与项目仓库为准。


2. Agent Skills:可复用的操作知识包

如果说 MCP 更像“工具和数据插座”,那么 Agent Skill 更像 Agent 按需打开的专业操作手册。

Agent Skills 规范定义了一种轻量开放格式:每个 Skill 至少是一个带 YAML 元数据与 Markdown 指令的 SKILL.md 文件,也可以包含脚本、参考资料与模板。Agent 启动时只加载名称与描述;任务匹配后再读取完整说明,并按需加载其他资源。这种 progressive disclosure(渐进式披露) 可以减少常驻上下文占用。

  • 它解决什么问题?
    • 把团队 SOP、领域知识、检查清单和脚本封装为可版本控制、可复用的目录,降低每次重新写长提示词的成本。
  • 它不保证什么?
    • Skill 不是新的模型能力,也不是安全沙箱。说明写错、依赖缺失或工具权限过大时,Agent 仍会失败或造成副作用。
  • 它与 MCP 如何配合?
    • Skill 可以告诉 Agent 何时、为何以及按什么步骤使用某个 MCP 工具;MCP 则提供实际的工具或数据连接。二者互补,但没有强制绑定。

“Skill”这个普通名词在不同产品里也可能指插件、提示模板或平台功能。本文特指最初由 Anthropic 开发、后来作为开放格式发布的 Agent Skills;不能假定所有叫 Skill 的产品都完全兼容这份规范。


3. A2A(Agent2Agent):让独立 Agent 互操作

Agent2Agent(A2A) 是一个用于独立、可能由不同厂商或框架构建的 Agent 系统之间通信与互操作的开放协议。它允许 Agent 发布 Agent Card 以描述身份、能力、端点与认证要求,并以 Message、Task、Artifact 等对象协商和跟踪工作。

A2A 与“在一个程序里启动多个子 Agent”不是同义词:

  • 内部多 Agent 编排:一个运行时自己拆任务、共享状态、调度多个角色,不一定需要网络协议。
  • A2A 互操作:一个 A2A Client 与外部 A2A Server(远程 Agent)按共同规范通信,重点是跨实现边界的发现、认证、消息和任务生命周期。

Google 于 2025 年 4 月发起 A2A,随后将其捐赠给 Linux Foundation。当前规范支持 JSON-RPC、gRPC、HTTP/REST 等协议绑定。下面的协作流程可以由单一框架内部实现,也可以在独立 Agent 均实现 A2A 时跨系统完成:

sequenceDiagram
    participant User as 用户
    participant PM as 路由/项目经理 Agent
    participant Coder as 研发 Agent
    participant QA as 测试/质检 Agent
 
    User->>PM: 提出需求: "开发一个在线格式化工具"
    PM->>Coder: 委派实现任务
    Coder->>QA: 提交产物与验证请求
    QA-->>Coder: 返回边界条件问题
    Coder-->>QA: 修复并重新验证
    QA-->>PM: 返回测试结果与产物
    PM->>User: 汇总交付并请求最终确认

Agent 究竟是什么?典型产品与框架

1. Chatbot 与 Agent 的区别

两者不是非黑即白的产品分类,而是一条能力光谱:

  • Chatbot(聊天机器人):主要围绕多轮对话生成回复,通常由用户逐步推动流程。
  • Agent(智能体):围绕目标管理状态,在一个循环中规划下一步、调用工具、读取结果、处理错误并继续执行,直到完成、失败或需要人工接管。

可以把常见 Agent 抽象为:

Agent=Model+Instructions+State/Memory+Tools+Control Loop+Guardrails\text{Agent} = \text{Model} + \text{Instructions} + \text{State/Memory} + \text{Tools} + \text{Control Loop} + \text{Guardrails}

“反思”并不是每个 Agent 都必须单列的模块;它可能表现为测试、验证器、重试策略、另一个审查 Agent 或人工审批。Agent 也不意味着无限自治:可靠系统通常会设置最大步数、预算、超时、权限范围和高风险确认点。


2. 典型 Agent 产品形态:不只有办公助手

办公 Agent 只是 Agent 落地的一类。真正火起来的,是一批“能进入具体工作现场”的产品:有的写代码,有的管知识库,有的操作浏览器,有的做研究,有的把多个专家角色组织成团队。

类型典型代表它们通常解决什么
办公 / 知识 AgentMicrosoft 365 CopilotGoogle Workspace with GeminiNotion AI飞书智能伙伴钉钉 AI腾讯元宝读文档、整理会议、写报告、生成 PPT、连接知识库和企业协作系统
编码 AgentCodexClaude CodeCursorWindsurfClineOpenHands理解代码库、编辑文件、运行测试、修复错误、生成补丁或 PR
浏览器 / Computer Use AgentChatGPT agentClaude Computer Use通过浏览器、截图、鼠标键盘或受控工具操作网页和软件界面
研究 / 搜索 AgentPerplexity、Gemini Deep Research、ChatGPT Deep Research、Genspark 等多轮检索、交叉验证来源、生成带引用的研究报告
多 Agent / Agent 平台腾讯云智能体开发平台、Dify、Coze、LangGraph、CrewAI、Semantic Kernel让开发者配置工具、知识库、工作流、多个角色和任务编排
本地自动化 Agent各类桌面助手、RPA + LLM、私有化 Agent在本地文件、浏览器、表格、脚本和企业内网工具之间执行重复任务

这些产品听起来都叫 Agent,但侧重点不同:办公 Agent 重在文件和协作系统,编码 Agent 重在工程反馈,浏览器 Agent 重在 UI 操作,研究 Agent 重在证据链,多 Agent 平台重在把流程编排成可复用应用。它们共同的风险也很像:权限过大、工具误用、提示注入、数据泄露、错误结果被自动写入业务系统。


3. Agent 产品、协议与框架矩阵

领域分类典型代表核心特点与状态
自主编码 AgentDevin(Cognition) / OpenHands面向较完整的软件任务;OpenHands 是开放源代码平台。与“辅助编码”之间不存在绝对边界
编码 Agent / AI 开发环境Codex / Claude Code / Cursor / Windsurf / Cline连接代码库、终端、浏览器或远程环境,支持规划、编辑、测试与审查;自治范围取决于权限与模式
办公与通用任务 Agent腾讯云 AI 产品 / Gemini / Notion AI / Microsoft 365 Copilot面向文件、研究、文档和跨应用工作流;支持平台、地区和套餐各不相同
浏览器 / Computer UseChatGPT agent / Claude Computer Use通过截图、鼠标、键盘或浏览器工具操作界面。OpenAI 原独立的 Operator 能力已并入 ChatGPT agent,不应再把 Operator 当作当前独立产品
状态图与工作流编排LangGraph用图、状态与持久化组织长运行、可恢复的 Agent 工作流
角色式多 Agent 框架CrewAI以 Agents、Crews 与 Flows 组织角色、任务和生产工作流
微软 Agent 框架Semantic Kernel / AutoGen微软生态中的 Agent/编排框架;不同项目成熟度和推荐路线会变化,新项目应查看官方仓库状态
跨 Agent 互操作协议A2A解决独立 Agent 的发现、消息、任务与产物交换,不是具体的编排框架
工具与上下文协议MCP连接 AI Host 与工具、资源和提示;不负责替代 A2A 的远程 Agent 任务语义
社交 / Web3 Agent 框架ElizaOS面向多平台社交 Agent、角色与插件生态;部署者仍需负责平台合规和密钥安全

补充思考:Scaling Law 下半场与未来展望

📝 1. Train-Time Scaling 与 Test-Time Scaling 正在并行发展

Scaling Law 没有失效,但它的内涵扩展了:除了预训练阶段的大规模计算(Train-Time Scaling),在推理阶段投入计算预算(Test-Time Scaling)同样能显著提高复杂任务的解决能力。未来的核心竞争力将来自于预训练、强化学习对齐与推理阶段并行探索的综合平衡。

💡 2. MCP + Skills + A2A 正在形成 Agent 协议基座

MCP 解决底层数据与工具通信,Skills 解决操作 SOP 知识复用,A2A 解决跨系统 Agent 协作。三者相互补充,共同构成了现代 Agent 系统的互联互通基座。

ℹ️ 3. 人工复核与安全边界依然至关重要

真正的 Agent 落地,绝非放任 AI 自由发酵,而是在自动化效率与人类可控性之间建立清晰的防护栏(Guardrails)。涉及高风险决策、真实扣费或关键代码部署时,确认机制与审计日志永远不可或缺。