AI学习导航

为什么做这个主页?

1、我每天高频研究和使用 AI,所以想将自己碎片吸收的各种 Note 卡片,汇总成一个完整的知识主题 Knowledge。
2、完整性。用户不喜欢为了完成一件事东拼西凑,更希望通过一个入口找到自己所需要的 AI 资源。
3、聚合。不必亲自生产所有东西,只要把足够多的人、商品或信息聚到同一个地方,也能产生巨大价值。
4、人是为别人而活的,为别人创造价值,从而体现自己的价值。——李诞

如何阅读?

预设了两个入口,一个是本篇文档,另一个是,我做了一个专门的网页。
所有带有“⭐️”的内容,都是认真沉淀的内容。

零、AI信息源

部分展开:

  • 🧠 技术/大模型
    • @karpathy —— 大模型、AI 编程,讲得特别透
    • @simonw —— 亲自测试各种 AI 工具,实战党必看
    • @rasbt —— 深入理解 LLM 原理和训练
    • @chipro —— AI 工程、数据、系统设计
  • 🤖 AI Agent / 开发
    • @swyx —— AI 工程、Agent、开发者生态
    • @DrJimFan —— Agent、机器人、具身智能
    • @AndrewYNg —— AI 应用、学习路线、行业趋势
  • 💡 AI + 工作/商业
    • @emollick —— AI 如何改变工作和普通人的生产力
    • @ylecun —— AI 底层技术和未来方向
    • @fchollet —— 专门帮你给 AI 热潮“降降温”

一、AI基础与核心概念

  • 以下某个概念不理解,可以直接让AI解读这个名词:用小白能理解的语言解释一下xxxx

AI概念框架_relations.png

1.1 AI系统是什么

  1. 机器学习(2026.08.25):让机器通过大量样本自己总结规律,再把这些规律用来处理新的问题。
  2. 深度学习(2026.08.25):用多层神经网络逐步提取复杂特征,是今天许多大模型和视觉模型的基础。
  3. 生成式AI(2026.08.25)⭐️:能够根据文字或其他输入,生成新的文字、代码、图片、声音和视频内容
  4. 基础模型(2026.08.25):先在广泛数据上学会通用能力,再被微调或接入应用,成为不同产品共用的模型底座。
  5. 大模型(LLM)(2026.08.24)⭐️:专门处理和生成语言的大模型,是聊天、写作、总结和代码助手的核心能力。(详细见第三部分展开的模型)
  6. AI系统生命周期(2026.08.25):描述 AI 系统从规划、数据和训练,到评估、上线、监控以及最终退出的完整过程。
  7. 100个AI名词解释:适合初学者按词查阅,用来快速建立 AI 名词之间的基本联系。

1.2 模型如何工作

  1. AI数据与输入(2026.08.25):模型训练和回答时实际能够接触到的资料,包括训练数据、Prompt、上传文件和检索结果。
  2. 词元(Token)(2026.08.24)⭐️:模型处理文字时使用的基本单位,文字会先被切成这些小块再进行计算
  3. 向量表示(Embedding)(2026.08.25)把文字、图片等内容转换成数字向量,让计算机能够比较它们在语义或特征上的相似程度
  4. 参数与权重(2026.08.25):模型训练后保留下来的大量数字,决定它如何根据输入计算和生成结果。
  5. Transformer(2026.08.25):以注意力机制为核心、帮助模型理解不同内容之间关系的一种基础网络架构。
  6. 注意力机制(Attention)(2026.08.25):让模型在处理当前内容时,动态判断输入中的哪些部分更值得重点参考。
  7. 上下文窗口(Context Window)(2026.08.24)模型当前一次任务能够看到和利用的信息范围,像它临时拥有的一张工作台。
  8. 模型推理(Inference)(2026.08.25):模型训练完成后,接收一次具体输入、经过计算并返回结果的实际运行过程。
  9. 解码(Decoding)(2026.08.25):模型根据下一步内容的概率,一步一步选择 Token,最终把计算结果变成完整回答。
  10. 推理能力(Reasoning)(2026.08.24):模型把学到的知识和方法用于比较、推导和检查,从而处理更复杂的问题。

1.3 模型如何获得能力(进阶)

  1. 预训练(Pre-training)(2026.08.24):让模型先在海量数据上学习语言、图像或代码等通用规律,相当于打基础的义务教育。
  2. 后训练(Post-training)(2026.08.24):在基础模型之上继续调整行为,让它更会听指令、遵守规则并按照人的偏好完成任务。
  3. 微调(Fine-tuning)(2026.08.25):在已有模型上继续训练,让它更适合某个具体领域、任务、格式或表达风格。
  4. 指令微调(Instruction Tuning)(2026.08.25):用大量“任务要求—理想答案”的示例,训练模型更准确地理解并执行人的指令。
  5. RLHF与RLAIF(2026.08.25):让人或另一个 AI 比较多个回答、给出偏好反馈,再用这些反馈调整模型行为。
  6. 对齐(Alignment)(2026.08.25):让模型的能力和行为尽量符合人的目标、产品规则以及安全和伦理要求。
  7. 蒸馏(Knowledge Distillation)(2026.08.24)⭐️:把教师模型或大模型的知识和行为迁移、压缩到更小、更省资源的学生模型中。
  8. 迁移学习(2026.08.25):把模型在一个任务或领域中学到的表示和方法,带到另一个相关任务中继续使用。

1.4 模型如何连接外部知识与工具

  1. Prompt(提示词)(2026.08.21)⭐️:你交给 AI 的任务说明书,好的 Prompt 会交代目标、背景、限制和期望的输出方式。
  2. 检索(Retrieval)(2026.08.25):从资料库中找出与当前问题相关的内容,为模型回答提供额外依据。
  3. 向量索引与向量数据库(2026.08.25):把资料转换成数字向量保存下来,再按语义相近程度快速找到相关内容。
  4. 检索增强生成(RAG)(2026.08.24)⭐️:回答前先检索外部资料,再把资料放进上下文,让模型尽量依据证据生成答案。
  5. Grounding(事实锚定)(2026.08.25):要求模型把回答建立在指定输入或可核验来源上,而不是只凭参数中的记忆自由发挥。
  6. 工具调用(Tool Calling)(2026.08.25)⭐️:模型先用结构化方式提出调用请求,再由外部程序执行搜索、计算、读写文件等动作。
  7. Agent(智能体)(2026.08.18)⭐️:接到目标后能拆解任务、选择工具、观察结果并继续行动,而不只是问一句答一句。
  8. AI记忆(Memory)(2026.08.25):让 AI 把用户偏好、项目背景或历史结果保存下来,并在未来任务中检索使用。
  9. 规划(Planning)(2026.08.25):把一个大目标拆成有顺序、有依赖关系、可以检查的小步骤。
  10. MCP(模型上下文协议)(2026.08.24)⭐️:让模型或 Agent 用统一方式连接外部工具、资料和提示模板的开放协议。
  11. Skill(AI技能)(2026.08.26)⭐️:把一类复杂任务的知识、步骤、工具和验收标准写成 AI 可以反复调用的说明书
  12. SOP(标准操作流程)(2026.08.08)⭐️:把人或团队反复执行的一件事固定成清晰、可复用、可检查的操作步骤。
  13. Agent记忆方法(2026.08.18)(实践补充):记录如何为 Agent 设计记忆的保存、检索、更新和清理方式,是 Memory 的实践入口。
  14. Skills、Commands、Agents、Plugins 概念(边界补充):用一张概念卡区分几种扩展组件分别负责知识、执行、命令和打包分发。
  15. 什么是 Skills,什么是 Agent?(入门补充):用最基础的语言解释 Agent 负责推进任务、Skill 负责提供做事方法。
  16. AI创作工作流(2026.08.18)(工作流补充):把选题、研究、创作、审核和发布等 AI 参与的步骤串起来,形成可重复的工作流。

1.5 模型如何处理不同模态

  1. 多模态(Multimodal)(2026.08.24)⭐️:模型不只处理文字,还能同时理解或生成图片、声音、视频等不同类型的信息
  2. 计算机视觉(2026.08.25):让机器从图片和视频中识别物体、文字、位置、动作和场景,并据此完成任务。
  3. OCR(光学字符识别)(2026.08.25)⭐️:把扫描件、截图或照片里的文字识别出来,转换成可以搜索、复制和编辑的文本。
  4. ASR(自动语音识别)(2026.08.20)⭐️:把人说的话转换成文字,是语音助手、会议转写和播客整理的基础环节。
  5. VAD(语音活动检测)(2026.08.20)判断一段音频中哪些时间有人说话、哪些时间是安静或背景噪声。
  6. 语音合成(TTS)(2026.08.25)⭐️:把文字转换成带有音色、语速和停顿的语音,用于配音、播报和语音助手。
  7. 媒体生成(2026.08.25):根据文字、图片或声音等条件,生成新的图片、视频、音乐、音效或配音内容。
  8. 扩散模型(2026.08.25):从随机噪声开始,在条件引导下逐步去噪,生成清晰的图片、声音或视频。
  9. 文生图(2026.08.22)(已有生成实践入口)⭐️:把文字描述转换成图片,常用于海报、插画、概念设计和视觉创作。

1.6 能力边界、评估与治理

  1. 幻觉(Hallucination)(2026.08.24)⭐️:AI 用很肯定的语气生成了听起来合理、但与事实或证据不一致的内容。
  2. 模型知识边界(2026.08.25):模型在训练数据、知识时间、当前上下文、外部工具和权限方面能够知道或做到的范围。
  3. AI评估(Evals)(2026.08.25)(含 Benchmark):用预先设计的测试题、标准和指标,检查模型或 AI 系统是否真的达到要求。
  4. AI鲁棒性与可靠性(2026.08.25):即使输入有变化、资料不完整或工具偶尔失败,系统也能尽量稳定地完成任务。
  5. AI偏差与公平性(2026.08.25):检查数据、目标或规则是否让 AI 对某些群体产生系统性的不公平结果。
  6. AI隐私与安全(2026.08.25):保护用户输入、模型数据、工具权限和系统接口,避免泄露、越权或被恶意利用。
  7. 人在回路(Human-in-the-loop)(2026.08.25):在高风险或关键步骤保留人工确认、否决和纠错,让 AI 不会完全脱离人的控制。
  8. AI护栏(Guardrails)(2026.08.25):在输入、输出、工具和流程上设置规则,拦截危险请求、越权操作和不合格结果。
  9. AI监控(Monitoring)(2026.08.25):系统上线后持续观察质量、延迟、成本、错误和风险,发现异常时及时处理。

工具与运行环境补充入口:

第一部分的概念卡是总入口,不替代后续主题的正文。第三部分继续介绍具体模型,第四部分继续介绍具体工具,第五部分继续介绍 MCP、Skills、Agent 和 SOP 的搭建与实践。

二、Prompt与交互

关于提示词

提示此部分可直接跳到skills部分

所有的提示词,我会做成一个独立的网页和你分享。即使如此,我也会在这里罗列一些我看到的优质提示词。
以下内容不分先后顺序。

2.1 文本对话

文本对话是通过文字与 AI 沟通,重点解决如何表达需求、组织上下文、复用提示词,以及检查和改进 AI 的回答。

李继刚曾用乔哈里视窗分析不同情况下,哪些信息应该告诉 AI,以及如何据此组织提示词。这个角度可以帮助初学者理解:提示词不是越长越好,而是要把当前任务真正需要的公开信息、背景信息和目标信息交代清楚。
乔哈里视窗与提示词信息

2.1.1 认知层面

001-为什么要学提示词工程

2.1.2 模板框架

001-AI提示词合集(2025.09.04)
002-如何向 ChatGPT 进行有效提问?
003-感觉充分表达-AI提示词
004-乔布斯的方法当提示词
005-12个精选 Prompt 框架
006-18个提示词写作框架
007-CARE 框架
008-COSTAR 框架
009-LangGPT
010-RICCE 框架
011-RODES 框架
012-《姚金刚提示词合集》
013-苏苏深度沟通提示词总结
014-向阳乔木-内容深度理解提示词
015-Agent记忆方法

2.1.3 提示词管理工具

001-提示词管理工具:旧项目,可不看

2.2 文生图

文生图是用文字描述主体、场景、风格、构图和修改要求,让 AI 生成或编辑图像。这里先收录直接可复用的提示词案例。

001-Nano-Banana创意提示词大集合(优化版):旧项目可忽略

三、AI模型🔥

当前市面上的 AI 模型(截至 2026.08.23)

  • 同一个模型家族可能同时属于多个分类;模型版本、价格、开放状态和地区可用性变化很快,使用前请回到官方页面核验。
  • 图谱是代表性市场地图,不是所有模型、微调模型和应用内模型的完整清单。
  • 查看图谱原图

当前市面上的AI模型_relations.png

3.1 媒体生成(图像、视频、音乐与声音)

媒体生成

Media 模型直接生成可视、可听的内容。选型时要区分“文字生图”“图生视频”“视频到视频”“数字人/声音”和“音乐生成”,它们往往不是同一个模型完成的。

3.1.1 图像生成

  • OpenAIGPT-Image-2,适合对话式创意生图、编辑与图文组合。
  • Google:Imagen、Gemini Image,适合图像生成、编辑和多模态创作工作流。
  • xAI:Grok Imagine,属于 Grok 生态中的媒体生成路线。
  • Qwen:Qwen-Image-2.0,提供图像生成与编辑能力。
  • 智谱:GLM-Image,属于 GLM 的图像生成分支。
  • 字节跳动 Seed:Seedream 5.0 Pro,强调设计理解和高质量图像生成。
  • 快手 Kling:Kling Image 3.0 / Omni,覆盖图像和全模态创作入口。

3.1.2 视频生成

  • Google DeepMind:Veo,面向视频生成和视频创作工作流。
  • 字节跳动 Seed:Seedance 2.0,支持文字、图片、音频、视频等多模态输入。
  • 快手 Kling:Kling 3.0 Video / Omni,覆盖视频生成、参考图和全模态视频创作。
  • MiniMax / 海螺 AI(Hailuo AI):Hailuo 2.3、Hailuo Video、MiniMax H3,覆盖文生视频、图生视频和 Media Agent。
  • 智谱:CogVideoX,属于视频生成模型路线。
  • Runway:Gen-4.5、Aleph,同时也是一个承载多种媒体模型的创作平台。

3.1.3 音乐、声音与实时媒体

  • Google DeepMind:Lyria 负责音乐生成;Gemini Audio 负责音频理解与交互。
  • MiniMax / 海螺 AI:Music 3.0、Speech 2.8,以及历史笔记中的 Hailuo Audio 入口,覆盖音乐、语音和声音生成。

海螺 AI:MiniMax 的媒体生成产品

海螺 AI(Hailuo AI)仍在运营,但它不是一家独立的模型公司,也不是单一模型,而是 MiniMax 旗下的媒体创作产品/平台。当前主线包括视频生成、图像/视频参考和 Media Agent;代表模型包括 Hailuo 2.3、Hailuo Video 以及 MiniMax H3。你笔记里记录的 hailuoai.com/audio 是早期语音功能入口,应归入本节的语音/音频分支。

  • OpenAI:Realtime、Audio 系列,适合实时语音对话和语音输入输出。
  • Qwen:Qwen3-Omni、Qwen3-TTS-Flash,适合全模态和语音生成场景。

相关入口:

3.2 通用语言与推理模型(文本对话模型)⭐️

这类模型主要处理问答、写作、总结、分析、知识工作、长上下文和复杂推理。下面按“模型家族”列出代表性公司归属,而不是把每一个旧版本都罗列出来。

公司/组织代表模型家族与型号主要特点获取方式
OpenAIGPT-5.6 Sol / Terra / Luna;gpt-oss-120b / 20b通用推理、工具调用、代码;另有开放权重路线GPT 主线 API/产品;gpt-oss 可下载部署
AnthropicClaude Fable / Opus / Sonnet 5;Haiku 4.5长文本、推理、视觉、代码与 Agent 工具使用Claude 产品、API、云平台合作
Google DeepMindGemini 3.7 Flash;Gemini 3.1 Pro原生多模态、长上下文、工具和 Google 生态Gemini 产品、API、Vertex AI
xAIGrok 4.6 / 4.5通用问答、推理、实时信息和多模态Grok 产品与 API
MetaLlama 4 Scout / Maverick;Muse开放权重、多模态、长上下文Meta、合作伙伴、云平台和本地生态
Mistral AIMedium 3.5;Small 4;Large 3通用推理、企业部署、代码和多语言商业 API + 部分开放权重
CohereCommand A+;Command A Reasoning企业文本、推理、检索增强和 Agent企业 API、云部署
阿里巴巴/QwenQwen3.7-Max / Plus;Qwen3-Max中文、多语言、推理、工具调用和全模态Qwen API + 多个开放权重系列
DeepSeekV4 Pro / Flash;V3.1 / R1思考/非思考、代码、推理和 AgentAPI + 部分开放权重分支
Z.ai/智谱GLM-5.3 / 5.2中文、推理、代码和多模态API + 部分开放权重/开源项目
月之暗面 / Moonshot AIKimi K3 / K2.6长上下文、原生视觉、代码和 AgentKimi 产品/API;部分开放模型
MiniMaxM3 / M2.7通用推理、代码、Agent 和媒体生成API + 部分开放模型与媒体产品
百度 / BaiduERNIE 5.1;ERNIE X1.1中文、推理、多模态和企业服务文心产品、百度智能云/API

3.3 多模态理解

  • 多模态模型不是“可以生成图片”这么简单,核心是能否同时理解文字、图片、音频或视频,并在不同模态之间进行推理。
  • 文本 + 图像:GPT、Claude、Gemini、Qwen-VL/Omni、GLM-5V、Kimi K3、Llama 4。
  • 文本 + 音频:Gemini Audio、OpenAI Realtime/Audio、Qwen3-Omni、MiniMax Speech。
  • 文本 + 视频:Gemini、Qwen Omni、GLM、Kimi 和 MiniMax 的多模态路线。
  • 全模态媒体输入:Seedance 2.0、Kling 3.0 Omni 等媒体模型,可以把图片、音频、视频作为创作参考。

3.4 代码与 Agent 专用模型

代码模型负责生成、解释、重构和测试代码;Agent 则是在模型之外增加工具调用、文件读写、终端、浏览器、记忆和流程控制。因此,“Agent 能力”通常是模型能力与工作台的组合,不只是一个模型名称。

  • OpenAI:GPT-5.3-Codex,配合 Codex 工作台完成代码与工程任务。
  • Anthropic:Claude 的代码与工具使用能力,配合 Claude Code 进行终端和仓库操作。
  • Google:Gemini 的代码能力,配合 Gemini CLI 使用。
  • Mistral AI:Codestral、Devstral,面向代码生成和软件工程 Agent。
  • Qwen:Qwen 的代码模型、工具调用和 Agent API 能力。
  • DeepSeek / Z.ai / Kimi / MiniMax:分别覆盖代码、推理、工具调用和 Agent 工作流。

已有实践入口:

3.5 拓展延伸——

1、语音、OCREmbedding 与 Rerank
2、开放权重与可部署模型

3.6 模型推荐

选模型时先按任务筛选,再按成本、速度、隐私和开放程度筛选:

  1. 写作、总结、复杂推理:优先比较 GPT、Claude、Gemini、Qwen、DeepSeek、GLM、Kimi 等通用模型。
  2. 图像、视频、音乐:优先比较 GPT-Image、Imagen/Veo、Seedream/Seedance、Kling、Runway、MiniMax、Qwen-Image 等媒体模型。
  3. 代码和 Agent:比较 GPT-Codex、Claude、Gemini、Codestral/Devstral、Qwen、DeepSeek、Kimi 等模型与工具链的组合。
  4. 知识库和 RAG:同时测试解析/OCR、Embedding、Rerank、聊天模型与引用质量。(国外:NotebookLM,国内:ima、得到大脑)
  5. 敏感数据、本地部署或微调:优先考察 Gemma、Llama、Qwen、Mistral、DeepSeek、GLM、Kimi 等开放权重路线。

3.7 本库的模型与模型产品笔记

这部分不是新增模型分类,而是把已有的模型研究、版本记录和模型体验统一挂在“模型”层,避免它们散落在工具或资源清单里。

四、AI工具

当前市面上的 AI工具(截至 2026.08.24)

当前市面上的AI工具_relations.png

4.1 通用助手与办公生产力

这类工具适合问答、写作、总结、文件处理、网页搜索、日常规划和个人知识工作。它们通常已经把聊天、搜索、图像、文件、代码和 Agent 能力合并在一个入口里。

代表工具公司归属主要用途工具形态
ChatGPTOpenAI通用对话、网页搜索、图像、文件、代码与 Agent模型公司自有应用入口
ClaudeAnthropic长文本、写作、分析、研究与代码模型公司自有应用入口
GeminiGoogle / Google DeepMind通用对话、多模态、搜索与 Google 生态模型公司自有应用入口
豆包字节跳动中文对话、办公、搜索、图像与视频国内通用助手
Kimi月之暗面 Moonshot AI长文本、资料分析、搜索、代码与 Agent国内通用助手
DeepSeekDeepSeek中文/英文问答、推理与代码模型公司自有应用入口
腾讯元宝腾讯中文对话、搜索、文件与办公国内通用助手

4.2 搜索、研究与知识管理

这类工具的重点不是“生成一段话”,而是检索网页、论文或用户资料,给出来源、引用、摘要和可追溯结论。

代表工具公司归属主要用途工具形态
PerplexityPerplexity AI带来源的网页问答、研究和搜索AI 搜索/研究助手,可接入多模型
Gemini Notebook(原 NotebookLM)Google基于用户资料研究、问答、摘要与引用资料库研究助手
GensparkMainFunc深度搜索、研究、生成页面与多步任务AI 工作空间/研究 Agent
Notion AINotion工作区问答、写作、会议记录、企业搜索与 Agent知识管理内置 AI,模型相对中立
ima / 腾讯 AI 知识管家腾讯科技(深圳)有限公司 / 腾讯个人与共享知识库、搜读写、基于资料问答、任务模式与内容产出AI 知识管理/工作台;可接入腾讯混元、DeepSeek 等模型
秘塔 AI 搜索秘塔科技 MetaSota中文网页检索、长文总结与研究式搜索中文 AI 搜索
ElicitElicit论文发现、筛选、信息提取与研究综述学术研究助手
ConsensusConsensus AI基于学术论文的研究问答学术搜索/证据助手

4.3 AI编程、CLI 与应用构建

AI 编程工具已经从“补全一行代码”发展到能够读取代码库、修改文件、运行命令、调用工具并执行多步工程任务的 Agentic Coding。要注意:Cursor、GitHub Copilot 等是工具产品,不等于它们调用的底层模型公司。

基础概念:什么是IDE?什么是CLI?

4.3.1 AI编程 CLI

CLI(Command-Line Interface,命令行界面)是通过终端与 AI Agent 交互的工具形态。它不是一种模型,也不是 MCP 或 Skills 本身;在实际使用中,CLI 往往同时承担 Agent Host 和本地执行环境的角色,让 AI 能够读取代码库、修改文件、运行命令、调用 MCP、加载 Skills,并在关键操作前请求授权。

代表工具公司归属主要用途工具形态
Claude CodeAnthropic读取代码库、修改文件、运行命令与完成多步开发任务终端代码 Agent
Codex CLI / CodexOpenAI代码生成、代码修改、测试与软件工程 Agent终端代码 Agent / 工作台
Gemini CLIGoogle在终端中进行代码理解、研究、文件操作与 Agentic Coding终端 Agent
CodeBuddy CLI腾讯终端代码开发,并与 IDE、浏览器插件和 MCP 能力协同CLI + IDE + 浏览器插件

CLI 工具可以按三个维度理解:交互方式是终端,执行主体通常是 Agent,扩展方式可以是 MCP、Skills、插件或本地脚本。CLI 相关的概念解释见什么是 IDE?什么是 CLI?,个人教程和实践见 9.9 Coding CLI与Skills

CLI、MCP 与 Skills 的关系

CLI 常常是 Agent Host;MCP 负责连接外部工具和数据,Skills 负责注入任务方法与验收标准。三者可以组合使用,但并不是同一个层次的概念。

4.3.2 AI IDE、云端应用构建与开发平台

除 CLI 外,AI 编程工具也包括带图形界面的 IDE、云端开发环境和自然语言应用构建平台。

代表工具公司归属主要用途工具形态
CursorAnysphereAI 原生 IDE、代码库 Agent、多模型编码独立 AI IDE,可路由多家模型
GitHub CopilotGitHub / MicrosoftIDE 补全、聊天、代码审查与编程 AgentIDE/开发者平台
Gemini Code AssistGoogleIDE 补全、代码审查与 Agentic CodingGoogle 开发工具入口
TRAE字节跳动AI IDE、代码库理解、Builder 与 Agent国内 AI IDE
Qoder阿里系 / Alibaba 生态Agentic Coding、终端开发与企业 AgentAI IDE/开发平台
CodeBuddy腾讯AI IDE、代码补全与软件开发 Agent国内开发工具
Replit AgentReplit用自然语言生成、部署和迭代应用云端应用构建
v0Vercel自然语言生成网页、React UI 与原型Web 应用构建

4.4 图像、视频、数字人与媒体生成

媒体生成内部还要继续区分图像/设计、视频、数字人、语音和音乐。不同工具的模型能力、版权策略、生成速度和可控性差异很大。

代表工具公司归属主要方向
MidjourneyMidjourney图像与视频生成、风格探索
Adobe FireflyAdobe图像、设计、填充、视频与创意工作流
Canva AI / Magic StudioCanva海报、演示、社交内容与设计工作流
RunwayRunway视频、图像、音频和创意制作;同时承载多种媒体模型
SoraOpenAI文生视频与图像/视频创作
VeoGoogle DeepMind视频生成
可灵 Kling快手视频、图像与多模态创作
海螺 AI / HailuoMiniMax视频生成、语音/音频与 Media Agent
即梦 AI / Seedance字节跳动 Seed图像、视频与创意生成
HeyGenHeyGen数字人、口播、翻译与视频
ElevenLabsElevenLabs语音合成、声音设计、配音与音频 Agent
SunoSuno音乐与歌曲生成
PikaPika Labs视频生成与特效
Luma Dream MachineLuma AI视频/图像生成

4.5 会议、录音、转写与个人记录

这类工具把录音、语音识别、说话人区分、会议摘要、行动项和知识检索组合在一起。

代表工具公司归属主要用途
Otter.aiOtter.ai会议转写、摘要、行动项与会议助手
Fireflies.aiFireflies.ai自动入会、转写、摘要、CRM/知识库同步
FathomFathom会议记录、总结与行动项
GranolaGranola桌面会议笔记与上下文整理
NottaNotta多语言录音转写与摘要
PlaudPlaud / Nicebuild录音硬件与 AI 转写、摘要、知识整理
得到大脑(原 Get 笔记)得到 / 北京思维造物信息科技股份有限公司语音记录、AI 转写、会议/课堂笔记、个人知识库、AI 搜索与内容创作个人知识管理/记录工具
通义听悟阿里云 / 阿里巴巴音视频转写、会议纪要与内容分析

4.6 自动化、Agent 与工作流编排

这类产品不是完成一次回答,而是把“触发器 → 模型 → 工具 → 判断 → 输出”连成可重复执行的流程。

代表工具公司归属主要用途工具形态
Zapier AIZapier连接 SaaS、触发任务、自动化与 AgentSaaS 自动化平台
MakeMake.com / Celonis 生态可视化多应用自动化工作流自动化平台
n8nn8n GmbH可自托管的节点式工作流、工具调用与 Agent开源/商业混合平台
DifyLangGeniusLLM 应用、知识库、Agent、工作流与 APIAI 应用平台
Coze字节跳动Bot、Agent、插件、工作流与发布Agent 构建/分发平台
LangChain / LangGraphLangChainAgent、工作流、模型与工具编排开发框架与平台生态
LindyLindy AI连接邮箱、日历、CRM、Slack 等服务面向非工程用户的 AI teammate
WorkBuddy腾讯 / 腾讯云一句话下达任务、多步骤办公 Agent、本地文件、文档/表格/PPT、研究、Skills/MCP 与多 Agent 协作全场景 AI 办公工作台/Agent 平台
GumloopGumloop无代码数据处理、研究与业务自动化AI 工作流平台
Microsoft Power AutomateMicrosoft企业流程自动化、RPA 与 Copilot 编排企业自动化平台

4.7 企业协作与业务平台

这类工具把 AI 嵌入 CRM、IT 服务、项目管理、办公套件、企业搜索和业务流程,并连接企业权限与内部数据。

代表工具公司归属主要用途
Microsoft 365 CopilotMicrosoftWord、Excel、PowerPoint、Outlook、Teams 与企业搜索
Salesforce AgentforceSalesforceCRM、销售、客服与业务 Agent
ServiceNow Now AssistServiceNowIT 服务、客户服务、知识与流程自动化
Atlassian RovoAtlassian企业搜索、知识发现、聊天与行动 Agent
Amazon QAWS / Amazon企业知识问答、软件开发与 AWS 工作流

4.8 中文市场工具的公司归属速记

  • 字节跳动:豆包、TRAE、即梦 AI、Seedance、Coze。
  • 阿里巴巴:通义/Qwen、通义听悟,以及 Qoder 生态。
  • 腾讯:腾讯元宝、混元、CodeBuddy、ima、WorkBuddy。
  • 月之暗面:Kimi。
  • DeepSeek:DeepSeek 助手、模型与 API。
  • MiniMax:海螺 AI、MiniMax API,以及文本、视频、语音和音乐产品线。
  • 得到 / 北京思维造物信息科技股份有限公司:得到大脑(原 Get 笔记)、得到 App 相关知识服务与 AI 记录能力。
  • 快手:可灵 Kling。
  • 百度、科大讯飞、智谱:分别形成文心/ERNIE、星火、GLM 等产品与模型生态。

4.9 AI 工具选型顺序

  1. 先定任务:写作/推理、搜索研究、代码、图像、视频、会议、自动化还是企业业务。
  2. 再看产品公司:账户、合同、支持、数据处理方、地区可用性和迁移风险由产品公司决定。
  3. 核对底层模型:工具可能自有模型、接入多家模型,或根据任务自动路由;不要只看产品宣传名称。
  4. 检查数据边界:是否上传敏感信息,是否支持私有化、本地部署、企业权限和审计日志。
  5. 测试真实样本:用自己的任务比较质量、稳定性、速度、成本、引用、可控性和导出能力。
  6. 保留迁移能力:提示词、知识库、工作流、生成内容和运行记录是否可以导出。

4.10 已有工具实践与延伸入口

这里集中挂接已有的产品笔记和使用记录。任务方法放在第二部分,MCP、Skills 和 Agent 的扩展机制放在第五部分。

4.10.1 搜索、研究与知识管理工具

4.10.2 编程、IDE 与 CLI 工具

4.10.3 媒体、图像、视频与语音工具

4.10.4 自动化、Agent 与业务工作台

五、MCP与Skills

MCP 与 Skills 是 AI 的能力扩展层(截至 2026.08.24)

  • **MCP(Model Context Protocol)**是开放协议,解决“AI 如何连接外部工具、数据和提示模板”;它起源于 Anthropic,但不属于某一个商业产品。
  • **Skills(AI 技能)**是可复用的任务知识、操作流程、脚本、参考资料和模板,解决“AI 如何稳定完成一类任务”。当前 Agent Skills 已形成开放规范,最小单元通常是包含 SKILL.md 的目录。
  • Agent/Host负责规划、选择和执行;MCP Server负责暴露外部能力;Plugin/Marketplace负责组合、发现、安装和分发。
  • 最好记的一句话:Agent 决定何时做,Skill 规定怎么做,MCP 提供能做什么,模型负责理解与生成,用户负责授权与验收。
  • 本机研究包(PNG、PDF、研究说明、来源清单):/Users/bairimengyushi/Downloads/MCP与Skills/
  • 已安装 Skills 的编号索引与逐项说明:Skills索引

5.1 先分清五个层次

层次解决什么问题代表对象典型归属
模型理解、推理和生成GPT、Claude、Gemini、Qwen模型公司
Agent/Host规划任务、调用能力、请求审批Claude Code、Codex、Cursor、WorkBuddyAI 产品公司
Skills固化领域知识、任务流程和验收标准SKILL.md、脚本、模板、参考资料开放规范 + 客户端实现
MCP统一连接外部工具、资源和提示JSON-RPC、Tools、Resources、Prompts开放协议生态
Plugin/Marketplace打包、发现、安装、升级和治理Agent Plugins、MCP Registry、Smithery、Docker Catalog标准组织、平台公司或社区

5.2 MCP 是什么:让 AI 接入外部世界

MCP 采用 Host—Client—Server 结构。Claude Code、Codex、Cursor、VS Code、Gemini CLI、WorkBuddy 等可以作为 Host;Host 内部的 MCP Client 连接一个或多个 MCP Server;Server 再把具体服务包装成标准能力。

MCP 能力作用例子
Tools可调用的动作,可能改变外部状态搜索、创建任务、读写文件、发消息、执行查询
Resources可读取的上下文或数据文档、数据库记录、项目文件、网页内容
PromptsServer 提供的提示模板或入口研究模板、代码审查模板、带参数的命令

常见部署方式:

  • stdio:Host 在本地启动 MCP Server 进程,适合文件、脚本、数据库和开发工具;便利但要警惕本地代码执行权限。
  • Streamable HTTP:连接远程或容器化 Server,适合 SaaS 和团队服务;涉及用户数据时要核验 OAuth、PKCE 和权限范围。
  • SSE:较早的远程传输方式,旧项目仍可能使用;新项目先看 Server 和客户端的官方推荐。

5.3 MCP Server 按能力分类

类别代表性连接对象典型用途
网页与搜索搜索引擎、Fetch、Playwright、浏览器检索网页、抓取资料、操作页面
文件与知识库本地文件、Notion、数据库、向量库读写资料、知识问答、查询记录
开发协作GitHub、GitLab、Linear、Sentry、终端Issue、代码、测试、部署和错误分析
办公协作邮件、日历、飞书、Slack、Teams查询日程、创建任务、发送消息
媒体与内容图像、音频、视频、PDF、演示文稿服务生成、转换、分析和发布内容
业务系统CRM、客服、ERP、广告和内部 API读取业务数据、执行流程和自动化
编排与治理聚合器、工具搜索、网关、日志和权限系统减少工具数量、动态发现、审计调用

已有资料:

5.4 MCP 生态与公司/组织归属

对象公司/组织在生态中的位置归属判断
MCP Specificationmodelcontextprotocol 社区,起源于 Anthropic协议、SDK、注册表和参考实现开放协议生态,不是单一 SaaS
Official MCP RegistryMCP 生态官方注册表,参与者包括 Anthropic、GitHub、Microsoft 等公共 Server 元数据、命名空间和发现 API官方注册表仍处于 Preview,不代表安全审计
SmitherySmitheryMCP Server 市场、托管连接和 OAuth/凭据服务第三方市场,不等于协议所有者
GlamaGlamaMCP Server 目录、托管与网关第三方目录,条目需自行核验
Docker MCP CatalogDocker版本化、容器化、带 SBOM 的 Server 目录Beta;容器降低环境冲突,不等于工具无风险
Agent Plugins开放标准社区;Cursor、VS Code、CodeBuddy 等采用以插件打包 Skills 与 MCP 配置分发/配置层,不替代 MCP 协议
扣子 / Coze北京春田知韵科技有限公司及关联方(与字节/飞书生态相关)内置 MCP Client,可基于 MCP 创建插件,也可把应用发布为 MCP 工具Agent、插件、工作流与 MCP 平台

主要 Host 的实现:

判断“某个 MCP 属于哪个公司”时,至少分开看:协议维护者、Server 开发者、Server 托管者、底层数据/动作提供者。一个社区 Server 出现在某个市场里,并不等于它由该市场开发或审计。

5.5 Skills 是什么:把任务方法装进 Agent

Agent Skills 开放规范的最小结构通常是:

skill-name/
├── SKILL.md          # 必需:元数据 + 指令
├── scripts/          # 可选:可执行脚本
├── references/       # 可选:按需加载的长资料
└── assets/           # 可选:模板、图片、字体、样例

SKILL.md 的核心通常是 namedescription,正文写任务边界、操作步骤、工具调用规则、输出格式和验收标准。Skills 的关键机制是渐进披露:先发现名称/描述,任务匹配后再加载全文,必要时再读取 references/assets 或执行脚本。

Skills 的五种常见类型:

  1. 知识型:行业术语、背景知识、判断标准和常见误区。
  2. 流程型:研究、写作、审校、发布、复盘等可重复步骤。
  3. 工具型:规定何时调用 MCP、CLI、浏览器或本地脚本。
  4. 格式型:把输入转换为 Markdown、PDF、表格、幻灯片、图像等。
  5. 治理型:来源核验、隐私处理、权限边界、质量检查和失败回退。

5.6 Skills 的生态与公司/产品实现

产品/生态公司/组织Skills 形态可移植性提示
Agent Skills开放标准,最初由 Anthropic 推动SKILL.md + 可选脚本/资源基础格式可跨兼容 Agent;扩展字段需实测
Claude CodeAnthropic自动调用、手动 /skill、子代理和调用控制支持标准并有 Claude 专属扩展
CodexOpenAISkill 文件夹、脚本、references、assets;也有 API Skills 资源适合放在项目或用户级目录
CursorAnysphere.cursor/skills.agents/skills、插件支持多层目录和 Agent Plugins
GitHub Copilot / VS CodeGitHub / Microsoft项目级、个人级 Agent Skills,可通过 gh skill 发现适合团队随代码库版本管理
Gemini CLIGooglegemini skills 的安装、链接、启用和禁用需要按 CLI 版本核验路径与命令
WorkBuddy / CodeBuddy腾讯 / 腾讯云.codebuddy/skills、市场/本地导入、插件、工具白名单与 Agent Skills 相似,但扩展字段有产品差异
扣子 / Coze北京春田知韵科技有限公司及关联方Agent、插件、工作流和技能;同时支持 MCP 插件产品内“技能”不自动等于 Agent Skills 开放规范
苏苏知识库个人工作区.agents/skills 与本地 Skill 目录以跨客户端兼容和可审查为优先

已有资料:

Agent Host 与 Skills 的使用记录:

5.7 MCP、Skills、Prompt、SOP、Plugin、Agent 的边界

名词主要回答的问题示例
Prompt这一次如何表达任务“请研究 MCP,并给出来源”
SOP人或团队固定怎么做先检索、再交叉验证、再发布
SkillAgent 如何把一类任务稳定做完研究→证据分级→结构化→画图→验收
MCP ServerAgent 能连接什么外部能力Playwright、Notion、GitHub、数据库
Plugin如何把多个扩展打包分发Skill + MCP + Hook + Agent
Agent谁来规划、选择、调用和执行Claude Code、Codex、WorkBuddy

最实用的组合是:**Agent 负责判断,Skill 负责方法,MCP 负责连接,模型负责推理,用户负责授权与验收。**例如本次研究中,research-to-diagram 是任务方法,agent-reach 是检索与来源路由,浏览器/文件/图像等 MCP 能力负责执行外部动作。

5.8 选择与安全检查

  • 先只读、后写入:搜索、读取、分析稳定后,再开放发消息、改数据库、删除文件、发布内容等写操作。
  • 检查来源与代码:优先官方 Server、官方组织仓库或可信企业仓库;第三方市场用于发现,不替代代码审查。
  • 区分本地与远程:stdio 可能执行本机代码;远程 HTTP 可能接触账号、请求内容和工具结果。
  • 最小权限:核对 OAuth scope、API key、工作区权限、允许工具列表和项目/用户作用域。
  • 审查 Skill:认真阅读 SKILL.mdscripts/、依赖包、安装钩子和环境变量;Skill 也可能诱导 Agent 越权。
  • 防提示注入和工具投毒:网页、文档、MCP 返回内容都应视为不可信输入;高风险动作必须人工确认。
  • 固定版本并验收:记录版本/commit,用固定样例测试发现准确率、执行成功率、结果可验证性和隐私风险。

5.9 推荐学习路径

  1. 先读 什么是 Skills,什么是 Agent? 和本节的分层表,建立名词边界。
  2. 在已有 Host 中连接一个只读 MCP Server,例如网页、Notion 或文件检索。
  3. 使用现成 Skill 完成一次固定任务,观察它如何发现、加载、调用工具和验收。
  4. 为自己的高频任务创建一个最小 SKILL.md,再逐步加入 references、脚本和模板。
  5. 把 Skill 与 MCP 配置打成插件或团队模板,加入权限审批、版本固定、日志和回退方案。
  6. 通过重复任务评估是否真的减少错误、上下文消耗和人工操作,再决定是否开放写权限。

5.10 研究来源与维护边界

MCP 规范、客户端功能、Skills 目录、产品套餐、市场条目和授权方式变化很快。本节负责建立稳定的分类与判断框架;具体安装前,回到对应产品官方文档核验版本、权限、数据边界和地区可用性。

待处理:

国务院关于深入实施“人工智能+”行动的意见 (这个是政策了解即可)