AI学习导航
为什么做这个主页?
1、我每天高频研究和使用 AI,所以想将自己碎片吸收的各种 Note 卡片,汇总成一个完整的知识主题 Knowledge。
2、完整性。用户不喜欢为了完成一件事东拼西凑,更希望通过一个入口找到自己所需要的 AI 资源。
3、聚合。不必亲自生产所有东西,只要把足够多的人、商品或信息聚到同一个地方,也能产生巨大价值。
4、人是为别人而活的,为别人创造价值,从而体现自己的价值。——李诞
如何阅读?
预设了两个入口,一个是本篇文档,另一个是,我做了一个专门的网页。
所有带有“⭐️”的内容,都是认真沉淀的内容。
零、AI信息源
汇总梳理中
部分展开:
- 🧠 技术/大模型
- 🤖 AI Agent / 开发
- @swyx —— AI 工程、Agent、开发者生态
- @DrJimFan —— Agent、机器人、具身智能
- @AndrewYNg —— AI 应用、学习路线、行业趋势
- 💡 AI + 工作/商业
一、AI基础与核心概念
- 以下某个概念不理解,可以直接让AI解读这个名词:
用小白能理解的语言解释一下xxxx

1.1 AI系统是什么
- 机器学习(2026.08.25):让机器通过大量样本自己总结规律,再把这些规律用来处理新的问题。
- 深度学习(2026.08.25):用多层神经网络逐步提取复杂特征,是今天许多大模型和视觉模型的基础。
- 生成式AI(2026.08.25)⭐️:能够根据文字或其他输入,生成新的文字、代码、图片、声音和视频内容。
- 基础模型(2026.08.25):先在广泛数据上学会通用能力,再被微调或接入应用,成为不同产品共用的模型底座。
- 大模型(LLM)(2026.08.24)⭐️:专门处理和生成语言的大模型,是聊天、写作、总结和代码助手的核心能力。(详细见第三部分展开的模型)
- AI系统生命周期(2026.08.25):描述 AI 系统从规划、数据和训练,到评估、上线、监控以及最终退出的完整过程。
- 100个AI名词解释:适合初学者按词查阅,用来快速建立 AI 名词之间的基本联系。
- AI生态系统全景图谱(个人索引使用,canvas白板,不 公开)
1.2 模型如何工作
- AI数据与输入(2026.08.25):模型训练和回答时实际能够接触到的资料,包括训练数据、Prompt、上传文件和检索结果。
- 词元(Token)(2026.08.24)⭐️:模型处理文字时使用的基本单位,文字会先被切成这些小块再进行计算。
- 向量表示(Embedding)(2026.08.25):把文字、图片等内容转换成数字向量,让计算机能够比较它们在语义或特征上的相似程度。
- 参数与权重(2026.08.25):模型训练后保留下来的大量数字,决定它如何根据输入计算和生成结果。
- Transformer(2026.08.25):以注意力机制为核心、帮助模型理解不同内容之间关系的一种基础网络架构。
- 注意力机制(Attention)(2026.08.25):让模型在处理当前内容时,动态判断输入中的哪些部分更值得重点参考。
- 上下文窗口(Context Window)(2026.08.24):模型当前一次任务能够看到和利用的信息范围,像它临时拥有的一张工作台。
- 模型推理(Inference)(2026.08.25):模型训练完成后,接收一次具体输入、经过计算并返回结果的实际运行过程。
- 解码(Decoding)(2026.08.25):模型根据下一步内容的概率,一步一步选择 Token,最终把计算结果变成完整回答。
- 推理能力(Reasoning)(2026.08.24):模型把学到的知识和方法用于比较、推导和检查,从而处理更复杂的问题。
1.3 模型如何获得能力(进阶)
- 预训练(Pre-training)(2026.08.24):让模型先在海量数据上学习语言、图像或代码等通用规律,相当于打基础的义务教育。
- 后训练(Post-training)(2026.08.24):在基础模型之上继续调整行为,让它更会听指令、遵守规则并按照人的偏好完成任务。
- 微调(Fine-tuning)(2026.08.25):在已有模型上继续训练,让它更适合某个具体领域、任务、格式或表达风格。
- 指令微调(Instruction Tuning)(2026.08.25):用大量“任务要求—理想答案”的示例,训练模型更准确地理解并执行人的指令。
- RLHF与RLAIF(2026.08.25):让人或另一个 AI 比较多个回答、给出偏好反馈,再用这些反馈调整模型行为。
- 对齐(Alignment)(2026.08.25):让模型的能力和行为尽量符合人的目标、产品规则以及安全和伦理要求。
- 蒸馏(Knowledge Distillation)(2026.08.24)⭐️:把教师模型或大模型的知识和行为迁移、压缩到更小、更省资源的学生模型中。
- 迁移学习(2026.08.25):把模型在一个任务或领域中学到的表示和方法,带到另一个相关任务中继续使用。
1.4 模型如何连接外部知识与工具
- Prompt(提示词)(2026.08.21)⭐️:你交给 AI 的任务说明书,好的 Prompt 会交代目标、背景、限制和期望的输出方式。
- 检索(Retrieval)(2026.08.25):从资料库中找出与当前问题相关的内容,为模型回答提供额外依据。
- 向量索引与向量数据库(2026.08.25):把资料转换成数字向量保存下来,再按语义相近程度快速找到相关内容。
- 检索增强生成(RAG)(2026.08.24)⭐️:回答前先检索外部资料,再把资料放进上下文,让模型尽量依据证据生成答案。
- Grounding(事实锚定)(2026.08.25):要求模型把回答建立在指定输入或可核验来源上,而不是只凭参数中的记忆自由发挥。
- 工具调用(Tool Calling)(2026.08.25)⭐️:模型先用结构化方式提出调用请求,再由外部程序执行搜索、计算、读写文件等动作。
- Agent(智能体)(2026.08.18)⭐️:接到目标后能拆解任务、选择工具、观察结果并继续行动,而不只是问一句答一句。
- AI记忆(Memory)(2026.08.25):让 AI 把用户偏好、项目背景或历史结果保存下来,并在未来任务中检索使用。
- 规划(Planning)(2026.08.25):把一个大目标拆成有顺序、有依赖关系、可以检查的小步骤。
- MCP(模型上下文协议)(2026.08.24)⭐️:让模型或 Agent 用统一方式连接外部工具、资料和提示模板的开放协议。
- Skill(AI技能)(2026.08.26)⭐️:把一类复杂任务的知识、步骤、工具和验收标准写成 AI 可以反复调用的说明书。
- SOP(标准操作流程)(2026.08.08)⭐️:把人或团队反复执行的一件事固定成清晰、可复用、可检查的操作步骤。
- Agent记忆方法(2026.08.18)(实践补充):记录如何为 Agent 设计记忆的保存、检索、更新和清理方式,是 Memory 的实践入口。
- Skills、Commands、Agents、Plugins 概念(边界补充):用一张概念卡区分几种扩展组件分别负责知识、执行、命令和打包分发。
- 什么是 Skills,什么是 Agent?(入门补充):用最基础的语言解释 Agent 负责推进任务、Skill 负责提供做事方法。
- AI创作工作流(2026.08.18)(工作流补充):把选题、研究、创作、审核和发布等 AI 参与的步骤串起来,形成可重复的工作流。
1.5 模型如何处理不同模态
- 多模态(Multimodal)(2026.08.24)⭐️:模型不只处理文字,还能同时理解或生成图片、声音、视频等不同类型的信息。
- 计算机视觉(2026.08.25):让机器从图片和视频中识别物体、文字、位置、动作和场景,并据此完成任务。
- OCR(光学字符识别)(2026.08.25)⭐️:把扫描件、截图或照片里的文字识别出来,转换成可以搜索、复制和编辑的文本。
- ASR(自动语音识别)(2026.08.20)⭐️:把人说的话转换成文字,是语音助手、会议转写和播客整理的基础环节。
- VAD(语音活动检测)(2026.08.20):判断一段音频中哪些时间有人说话、哪些时间是安静或背景噪声。
- 语音合成(TTS)(2026.08.25)⭐️:把文字转换成带有音色、语速和停顿的语音,用于配音、播报和语音助手。
- 媒体生成(2026.08.25):根据文字、图片或声音等条件,生成新的图片、视频、音乐、音效或配音内容。
- 扩散模型(2026.08.25):从随机噪声开始,在条件引导下逐步去噪,生成清晰的图片、声音或视频。
- 文生图(2026.08.22)(已有生成实践入口)⭐️:把文字描述转换成图片,常用于海报、插画、概念设计和视觉创作。
1.6 能力边界、评估与治理
- 幻觉(Hallucination)(2026.08.24)⭐️:AI 用很肯定的语气生成了听起来合理、但与事实或证据不一致的内容。
- 模型知识边界(2026.08.25):模型在训练数据、知识时间、当前上下文、外部工具和权限方面能够知道或做到的范围。
- AI评估(Evals)(2026.08.25)(含 Benchmark):用预先设计的测试题、标准和指标,检查模型或 AI 系统是否真的达到要求。
- AI鲁棒性与可靠性(2026.08.25):即使输入有变化、资料不完整或工具偶尔失败,系统也能尽量稳定地完成任务。
- AI偏差与公平性(2026.08.25):检查数据、目标或规则是否让 AI 对某些群体产生系统性的不公平结果。
- AI隐私与安全(2026.08.25):保护用户输入、模型数据、工具权限和系统接口,避免泄露、越权或被恶意利用。
- 人在回路(Human-in-the-loop)(2026.08.25):在高风险或关键步骤保留人工确认、否决和纠错,让 AI 不会完全脱离人的控制。
- AI护栏(Guardrails)(2026.08.25):在输入、输出、工具和流程上设置规则,拦截危险请求、越权操作和不合格结果。
- AI监控(Monitoring)(2026.08.25):系统上线后持续观察质量、延迟、成本、错误和风险,发现异常时及时处理。
工具与运行环境补充入口:
- CLI(命令行界面)(2026.08.24)、IDE(集成开发环境)(2026.08.24):CLI 用命令输入操作电脑,IDE 提供代码编辑、运行和调试等集中式开发界面。
- Codex(AI工作台)(2026.08.18)、Codex会话(2026.08.10):Codex 是让 AI 操作文件和终端的工作台,会话则是一次连续的任务上下文。
- WorkBuddy(2026.08.18)、ima(2026.07.30):把 AI 放进办公、资料整理和知识管理场景,帮助用户搜索、阅读、写作和执行任务的应用。
- AI账号管理(2026.08.08)(账号与权限补充):统一管理不同 AI 服务的账号、权限、订阅和使用成本,避免混乱或越权。
- NotebookLM 工具入口:围绕用户提供的资料进行阅读、提问和总结,而不是只依赖模型自身的通用知识。
第一部分的概念卡是总入口,不替代后续主题的正文。第三部分继续介绍具体模型,第四部分继续介绍具体工具,第五部分继续介绍 MCP、Skills、Agent 和 SOP 的搭建与实践。
二、Prompt与交互
关于提示词
提示此部分可直接跳到skills部分
所有的提示词,我会做成一个独立的网页和你分享。即使如此,我也会在这里罗列一些我看到的优质提示词。
以下内容不分先后顺序。
2.1 文本对话
文本对话是通过文字与 AI 沟通,重点解决如何表达需求、组织上下文、复用提示词,以及检查和改进 AI 的回答。
李继刚曾用乔哈里视窗分析不同情况下,哪些信息应该告诉 AI,以及如何据此组织提示词。这个角度可以帮助初学者理解:提示词不是越长越好,而是要把当前任务真正需要的公开信息、背景信息和目标信息交代清楚。

2.1.1 认知层面
001-为什么要学提示词工程
2.1.2 模板框架
001-AI提示词合集(2025.09.04)
002-如何向 ChatGPT 进行有效提问?
003-感觉充分表达-AI提示词 ⭐
004-乔布斯的方法当提示词
005-12个精选 Prompt 框架
006-18个提示词写作框架
007-CARE 框架
008-COSTAR 框架
009-LangGPT
010-RICCE 框架
011-RODES 框架
012-《姚金刚提示词合集》
013-苏苏深度沟通提示词总结
014-向阳乔木-内容深度理解提示词
015-Agent记忆方法
2.1.3 提示词管理工具
001-提示词管理工具:旧项目,可不看
2.2 文生图
文生图是用文字描述主体、场景、风格、构图和修改要求,让 AI 生成或编辑图像。这里先收录直接可复用的提示词案例。
001-Nano-Banana创意提示词大集合(优化版):旧项目可忽略
三、AI模型🔥
当前市面上的 AI 模型(截至 2026.08.23)
- 同一个模型家族可能同时属于多个分类;模型版本、价格、开放状态和地区可用性变化很快,使用前请回到官方页面核验。
- 图谱是代表性市场地图,不是所有模型、微调模型和应用内模型的完整清单。
- 查看图谱原图

3.1 媒体生成(图像、视频、音乐与声音)
媒体生成
Media 模型直接生成可视、可听的内容。选型时要区分“文字生图”“图生视频”“视频到视频”“数字人/声音”和“音乐生成”,它们往往不是同一个模型完成的。
3.1.1 图像生成
- OpenAI:GPT-Image-2,适合对话式创意生图、编辑与图文组合。
- Google:Imagen、Gemini Image,适合图像生成、编辑和多模态创作工作流。
- xAI:Grok Imagine,属于 Grok 生态中的媒体生成路线。
- Qwen:Qwen-Image-2.0,提供图像生成与编辑能力。
- 智谱:GLM-Image,属于 GLM 的图像生成分支。
- 字节跳动 Seed:Seedream 5.0 Pro,强调设计理解和高质量图像生成。
- 快手 Kling:Kling Image 3.0 / Omni,覆盖图像和全模态创作入口。
3.1.2 视频生成
- Google DeepMind:Veo,面向视频生成和视频创作工作流。
- 字节跳动 Seed:Seedance 2.0,支持文字、图片、音频、视频等多模态输入。
- 快手 Kling:Kling 3.0 Video / Omni,覆盖视频生成、参考图和全模态视频创作。
- MiniMax / 海螺 AI(Hailuo AI):Hailuo 2.3、Hailuo Video、MiniMax H3,覆盖文生视频、图生视频和 Media Agent。
- 智谱:CogVideoX,属于视频生成模型路线。
- Runway:Gen-4.5、Aleph,同时也是一个承载多种媒体模型的创作平台。
3.1.3 音乐、声音与实时媒体
- Google DeepMind:Lyria 负责音乐生成;Gemini Audio 负责音频理解与交互。
- MiniMax / 海螺 AI:Music 3.0、Speech 2.8,以及历史笔记中的 Hailuo Audio 入口,覆盖音乐、语音和声音生成。
海螺 AI:MiniMax 的媒体生成产品
海螺 AI(Hailuo AI)仍在运营,但它不是一家独立的模型公司,也不是单一模型,而是 MiniMax 旗下的媒体创作产品/平台。当前主线包括视频生成、图像/视频参考和 Media Agent;代表模型包括 Hailuo 2.3、Hailuo Video 以及 MiniMax H3。你笔记里记录的
hailuoai.com/audio是早期语音功能入口,应归入本节的语音/音频分支。
- OpenAI:Realtime、Audio 系列,适合实时语音对话和语音输入输出。
- Qwen:Qwen3-Omni、Qwen3-TTS-Flash,适合全模态和语音生成场景。
相关入口:
3.2 通用语言与推理模型(文本对话模型)⭐️
这类模型主要处理问答、写作、总结、分析、知识工作、长上下文和复杂推理。下面按“模型家族”列出代表性公司归属,而不是把每一个旧版本都罗列出来。
| 公司/组织 | 代表模型家族与型号 | 主要特点 | 获取方式 | |
|---|---|---|---|---|
| OpenAI | GPT-5.6 Sol / Terra / Luna;gpt-oss-120b / 20b | 通用推理、工具调用、代码;另有开放权重路线 | GPT 主线 API/产品;gpt-oss 可下载部署 | |
| Anthropic | Claude Fable / Opus / Sonnet 5;Haiku 4.5 | 长文本、推理、视觉、代码与 Agent 工具使用 | Claude 产品、API、云平台合作 | |
| Google DeepMind | Gemini 3.7 Flash;Gemini 3.1 Pro | 原生多模态、长上下文、工具和 Google 生态 | Gemini 产品、API、Vertex AI | |
| xAI | Grok 4.6 / 4.5 | 通用问答、推理、实时信息和多模态 | Grok 产品与 API | |
| Meta | Llama 4 Scout / Maverick;Muse | 开放权重、多模态、长上下文 | Meta、合作伙伴、云平台和本地生态 | |
| Mistral AI | Medium 3.5;Small 4;Large 3 | 通用推理、企业部署、代码和多语言 | 商业 API + 部分开放权重 | |
| Cohere | Command A+;Command A Reasoning | 企业文本、推理、检索增强和 Agent | 企业 API、云部署 | |
| 阿里巴巴/Qwen | Qwen3.7-Max / Plus;Qwen3-Max | 中文、多语言、推理、工具调用和全模态 | Qwen API + 多个开放权重系列 | |
| DeepSeek | V4 Pro / Flash;V3.1 / R1 | 思考/非思考、代码、推理和 Agent | API + 部分开放权重分支 | |
| Z.ai/智谱 | GLM-5.3 / 5.2 | 中文、推理、代码和多模态 | API + 部分开放权重/开源项目 | |
| 月之暗面 / Moonshot AI | Kimi K3 / K2.6 | 长上下文、原生视觉、代码和 Agent | Kimi 产品/API;部分开放模型 | |
| MiniMax | M3 / M2.7 | 通用推理、代码、Agent 和媒体生成 | API + 部分开放模型与媒体产品 | |
| 百度 / Baidu | ERNIE 5.1;ERNIE X1.1 | 中文、推理、多模态和企业服务 | 文心产品、百度智能云/API |
3.3 多模态理解
- 多模态模型不是“可以生成图片”这么简单,核心是能否同时理解文字、图片、音频或视频,并在不同模态之间进行推理。
- 文本 + 图像:GPT、Claude、Gemini、Qwen-VL/Omni、GLM-5V、Kimi K3、Llama 4。
- 文本 + 音频:Gemini Audio、OpenAI Realtime/Audio、Qwen3-Omni、MiniMax Speech。
- 文本 + 视频:Gemini、Qwen Omni、GLM、Kimi 和 MiniMax 的多模态路线。
- 全模态媒体输入:Seedance 2.0、Kling 3.0 Omni 等媒体模型,可以把图片、音频、视频作为创作参考。
3.4 代码与 Agent 专用模型
代码模型负责生成、解释、重构和测试代码;Agent 则是在模型之外增加工具调用、文件读写、终端、浏览器、记忆和流程控制。因此,“Agent 能力”通常是模型能力与工作台的组合,不只是一个模型名称。
- OpenAI:GPT-5.3-Codex,配合 Codex 工作台完成代码与工程任务。
- Anthropic:Claude 的代码与工具使用能力,配合 Claude Code 进行终端和仓库操作。
- Google:Gemini 的代码能力,配合 Gemini CLI 使用。
- Mistral AI:Codestral、Devstral,面向代码生成和软件工程 Agent。
- Qwen:Qwen 的代码模型、工具调用和 Agent API 能力。
- DeepSeek / Z.ai / Kimi / MiniMax:分别覆盖代码、推理、工具调用和 Agent 工作流。
已有实践入口:
3.5 拓展延伸——
1、语音、OCR、Embedding 与 Rerank
2、开放权重与可部署模型
语音、OCR、Embedding 与 Rerank
这类模型常常不在聊天榜单里出现,却是 AI 应用的基础设施:
- 语音识别 / 转写:OpenAI Live Transcribe、Mistral Voxtral、Qwen ASR、MiniMax Speech、Gemini Audio。
- 语音合成 / 实时语音:OpenAI Realtime、Qwen TTS、MiniMax Speech、Google Audio。
- OCR / 文档理解:Mistral OCR、GLM-OCR,以及 Gemini、Qwen 等多模态模型的文档能力。
- Embedding / Rerank:OpenAI text-embedding、Google EmbeddingGemma、Cohere Embed/Rerank、Mistral Embed。
如果要做知识库或 RAG,不要只比较聊天模型。至少要同时考虑:Embedding 的检索质量、Rerank 的排序质量、文档解析/OCR、上下文长度、数据隐私与调用成本。
可部署模型
开放权重适合本地运行、私有云、量化、微调和对数据边界要求较高的场景,但“开放权重”不等于训练数据、训练代码和商业许可全部开放。
开放路线 公司归属 代表模型 适合场景 gpt-oss OpenAI gpt-oss-120b / 20b 自托管、研究、企业私有部署 Gemma Gemma 4、EmbeddingGemma、ShieldGemma 端侧、小型服务、Embedding 与安全 Llama Meta Llama 4 Scout / Maverick 本地部署、微调、生态集成 Qwen 阿里巴巴 Qwen3 系列及视觉、代码、语音分支 中文、多语言、全模态与私有化 Mistral Mistral AI Small、部分 Medium/代码/OCR 系列 欧洲部署、代码、企业服务 DeepSeek DeepSeek V3.1、R1 等分支 推理、代码、本地实验 GLM / CogVideoX Z.ai / 智谱 GLM、GLM-5V、CogVideoX、GLM-OCR 中文、多模态、媒体与 OCR Kimi Moonshot AI K3、K2.6 长上下文、视觉、代码与 Agent H3 MiniMax H3 视频模型 视频生成与媒体研究 Aya Cohere Aya、Tiny Aya 多语言与研究型应用 部署前要核对四件事:许可证是否允许商用、权重是否真的可下载、硬件与显存是否匹配、模型安全与数据责任由谁承担。
3.6 模型推荐
选模型时先按任务筛选,再按成本、速度、隐私和开放程度筛选:
- 写作、总结、复杂推理:优先比较 GPT、Claude、Gemini、Qwen、DeepSeek、GLM、Kimi 等通用模型。
- 图像、视频、音乐:优先比较 GPT-Image、Imagen/Veo、Seedream/Seedance、Kling、Runway、MiniMax、Qwen-Image 等媒体模型。
- 代码和 Agent:比较 GPT-Codex、Claude、Gemini、Codestral/Devstral、Qwen、DeepSeek、Kimi 等模型与工具链的组合。
- 知识库和 RAG:同时测试解析/OCR、Embedding、Rerank、聊天模型与引用质量。(国外:NotebookLM,国内:ima、得到大脑)
- 敏感数据、本地部署或微调:优先考察 Gemma、Llama、Qwen、Mistral、DeepSeek、GLM、Kimi 等开放权重路线。
3.7 本库的模型与模型产品笔记
这部分不是新增模型分类,而是把已有的模型研究、版本记录和模型体验统一挂在“模型”层,避免它们散落在工具或资源清单里。
四、AI工具
当前市面上的 AI工具(截至 2026.08.24)

4.1 通用助手与办公生产力
这类工具适合问答、写作、总结、文件处理、网页搜索、日常规划和个人知识工作。它们通常已经把聊天、搜索、图像、文件、代码和 Agent 能力合并在一个入口里。
| 代表工具 | 公司归属 | 主要用途 | 工具形态 |
|---|---|---|---|
| ChatGPT | OpenAI | 通用对话、网页搜索、图像、文件、代码与 Agent | 模型公司自有应用入口 |
| Claude | Anthropic | 长文本、写作、分析、研究与代码 | 模型公司自有应用入口 |
| Gemini | Google / Google DeepMind | 通用对话、多模态、搜索与 Google 生态 | 模型公司自有应用入口 |
| 豆包 | 字节跳动 | 中文对话、办公、搜索、图像与视频 | 国内通用助手 |
| Kimi | 月之暗面 Moonshot AI | 长文本、资料分析、搜索、代码与 Agent | 国内通用助手 |
| DeepSeek | DeepSeek | 中文/英文问答、推理与代码 | 模型公司自有应用入口 |
| 腾讯元宝 | 腾讯 | 中文对话、搜索、文件与办公 | 国内通用助手 |
4.2 搜索、研究与知识管理
这类工具的重点不是“生成一段话”,而是检索网页、论文或用户资料,给出来源、引用、摘要和可追溯结论。
| 代表工具 | 公司归属 | 主要用途 | 工具形态 |
|---|---|---|---|
| Perplexity | Perplexity AI | 带来源的网页问答、研究和搜索 | AI 搜索/研究助手,可接入多模型 |
| Gemini Notebook(原 NotebookLM) | 基于用户资料研究、问答、摘要与引用 | 资料库研究助手 | |
| Genspark | MainFunc | 深度搜索、研究、生成页面与多步任务 | AI 工作空间/研究 Agent |
| Notion AI | Notion | 工作区问答、写作、会议记录、企业搜索与 Agent | 知识管理内置 AI,模型相对中立 |
| ima / 腾讯 AI 知识管家 | 腾讯科技(深圳)有限公司 / 腾讯 | 个人与共享知识库、搜读写、基于资料问答、任务模式与内容产出 | AI 知识管理/工作台;可接入腾讯混元、DeepSeek 等模型 |
| 秘塔 AI 搜索 | 秘塔科技 MetaSota | 中文网页检索、长文总结与研究式搜索 | 中文 AI 搜索 |
| Elicit | Elicit | 论文发现、筛选、信息提取与研究综述 | 学术研究助手 |
| Consensus | Consensus AI | 基于学术论文的研究问答 | 学术搜索/证据助手 |
4.3 AI编程、CLI 与应用构建
AI 编程工具已经从“补全一行代码”发展到能够读取代码库、修改文件、运行命令、调用工具并执行多步工程任务的 Agentic Coding。要注意:Cursor、GitHub Copilot 等是工具产品,不等于它们调用的底层模型公司。
基础概念:什么是IDE?什么是CLI?
4.3.1 AI编程 CLI
CLI(Command-Line Interface,命令行界面)是通过终端与 AI Agent 交互的工具形态。它不是一种模型,也不是 MCP 或 Skills 本身;在实际使用中,CLI 往往同时承担 Agent Host 和本地执行环境的角色,让 AI 能够读取代码库、修改文件、运行命令、调用 MCP、加载 Skills,并在关键操作前请求授权。
| 代表工具 | 公司归属 | 主要用途 | 工具形态 |
|---|---|---|---|
| Claude Code | Anthropic | 读取代码库、修改文件、运行命令与完成多步开发任务 | 终端代码 Agent |
| Codex CLI / Codex | OpenAI | 代码生成、代码修改、测试与软件工程 Agent | 终端代码 Agent / 工作台 |
| Gemini CLI | 在终端中进行代码理解、研究、文件操作与 Agentic Coding | 终端 Agent | |
| CodeBuddy CLI | 腾讯 | 终端代码开发,并与 IDE、浏览器插件和 MCP 能力协同 | CLI + IDE + 浏览器插件 |
CLI 工具可以按三个维度理解:交互方式是终端,执行主体通常是 Agent,扩展方式可以是 MCP、Skills、插件或本地脚本。CLI 相关的概念解释见什么是 IDE?什么是 CLI?,个人教程和实践见 9.9 Coding CLI与Skills。
CLI、MCP 与 Skills 的关系
CLI 常常是 Agent Host;MCP 负责连接外部工具和数据,Skills 负责注入任务方法与验收标准。三者可以组合使用,但并不是同一个层次的概念。
4.3.2 AI IDE、云端应用构建与开发平台
除 CLI 外,AI 编程工具也包括带图形界面的 IDE、云端开发环境和自然语言应用构建平台。
| 代表工具 | 公司归属 | 主要用途 | 工具形态 |
|---|---|---|---|
| Cursor | Anysphere | AI 原生 IDE、代码库 Agent、多模型编码 | 独立 AI IDE,可路由多家模型 |
| GitHub Copilot | GitHub / Microsoft | IDE 补全、聊天、代码审查与编程 Agent | IDE/开发者平台 |
| Gemini Code Assist | IDE 补全、代码审查与 Agentic Coding | Google 开发工具入口 | |
| TRAE | 字节跳动 | AI IDE、代码库理解、Builder 与 Agent | 国内 AI IDE |
| Qoder | 阿里系 / Alibaba 生态 | Agentic Coding、终端开发与企业 Agent | AI IDE/开发平台 |
| CodeBuddy | 腾讯 | AI IDE、代码补全与软件开发 Agent | 国内开发工具 |
| Replit Agent | Replit | 用自然语言生成、部署和迭代应用 | 云端应用构建 |
| v0 | Vercel | 自然语言生成网页、React UI 与原型 | Web 应用构建 |
4.4 图像、视频、数字人与媒体生成
媒体生成内部还要继续区分图像/设计、视频、数字人、语音和音乐。不同工具的模型能力、版权策略、生成速度和可控性差异很大。
| 代表工具 | 公司归属 | 主要方向 |
|---|---|---|
| Midjourney | Midjourney | 图像与视频生成、风格探索 |
| Adobe Firefly | Adobe | 图像、设计、填充、视频与创意工作流 |
| Canva AI / Magic Studio | Canva | 海报、演示、社交内容与设计工作流 |
| Runway | Runway | 视频、图像、音频和创意制作;同时承载多种媒体模型 |
| Sora | OpenAI | 文生视频与图像/视频创作 |
| Veo | Google DeepMind | 视频生成 |
| 可灵 Kling | 快手 | 视频、图像与多模态创作 |
| 海螺 AI / Hailuo | MiniMax | 视频生成、语音/音频与 Media Agent |
| 即梦 AI / Seedance | 字节跳动 Seed | 图像、视频与创意生成 |
| HeyGen | HeyGen | 数字人、口播、翻译与视频 |
| ElevenLabs | ElevenLabs | 语音合成、声音设计、配音与音频 Agent |
| Suno | Suno | 音乐与歌曲生成 |
| Pika | Pika Labs | 视频生成与特效 |
| Luma Dream Machine | Luma AI | 视频/图像生成 |
4.5 会议、录音、转写与个人记录
这类工具把录音、语音识别、说话人区分、会议摘要、行动项和知识检索组合在一起。
| 代表工具 | 公司归属 | 主要用途 | |
|---|---|---|---|
| Otter.ai | Otter.ai | 会议转写、摘要、行动项与会议助手 | |
| Fireflies.ai | Fireflies.ai | 自动入会、转写、摘要、CRM/知识库同步 | |
| Fathom | Fathom | 会议记录、总结与行动项 | |
| Granola | Granola | 桌面会议笔记与上下文整理 | |
| Notta | Notta | 多语言录音转写与摘要 | |
| Plaud | Plaud / Nicebuild | 录音硬件与 AI 转写、摘要、知识整理 | |
| 得到大脑(原 Get 笔记) | 得到 / 北京思维造物信息科技股份有限公司 | 语音记录、AI 转写、会议/课堂笔记、个人知识库、AI 搜索与内容创作 | 个人知识管理/记录工具 |
| 通义听悟 | 阿里云 / 阿里巴巴 | 音视频转写、会议纪要与内容分析 |
4.6 自动化、Agent 与工作流编排
这类产品不是完成一次回答,而是把“触发器 → 模型 → 工具 → 判断 → 输出”连成可重复执行的流程。
| 代表工具 | 公司归属 | 主要用途 | 工具形态 |
|---|---|---|---|
| Zapier AI | Zapier | 连接 SaaS、触发任务、自动化与 Agent | SaaS 自动化平台 |
| Make | Make.com / Celonis 生态 | 可视化多应用自动化 | 工作流自动化平台 |
| n8n | n8n GmbH | 可自托管的节点式工作流、工具调用与 Agent | 开源/商业混合平台 |
| Dify | LangGenius | LLM 应用、知识库、Agent、工作流与 API | AI 应用平台 |
| Coze | 字节跳动 | Bot、Agent、插件、工作流与发布 | Agent 构建/分发平台 |
| LangChain / LangGraph | LangChain | Agent、工作流、模型与工具编排 | 开发框架与平台生态 |
| Lindy | Lindy AI | 连接邮箱、日历、CRM、Slack 等服务 | 面向非工程用户的 AI teammate |
| WorkBuddy | 腾讯 / 腾讯云 | 一句话下达任务、多步骤办公 Agent、本地文件、文档/表格/PPT、研究、Skills/MCP 与多 Agent 协作 | 全场景 AI 办公工作台/Agent 平台 |
| Gumloop | Gumloop | 无代码数据处理、研究与业务自动化 | AI 工作流平台 |
| Microsoft Power Automate | Microsoft | 企业流程自动化、RPA 与 Copilot 编排 | 企业自动化平台 |
4.7 企业协作与业务平台
这类工具把 AI 嵌入 CRM、IT 服务、项目管理、办公套件、企业搜索和业务流程,并连接企业权限与内部数据。
| 代表工具 | 公司归属 | 主要用途 |
|---|---|---|
| Microsoft 365 Copilot | Microsoft | Word、Excel、PowerPoint、Outlook、Teams 与企业搜索 |
| Salesforce Agentforce | Salesforce | CRM、销售、客服与业务 Agent |
| ServiceNow Now Assist | ServiceNow | IT 服务、客户服务、知识与流程自动化 |
| Atlassian Rovo | Atlassian | 企业搜索、知识发现、聊天与行动 Agent |
| Amazon Q | AWS / Amazon | 企业知识问答、软件开发与 AWS 工作流 |
4.8 中文市场工具的公司归属速记
- 字节跳动:豆包、TRAE、即梦 AI、Seedance、Coze。
- 阿里巴巴:通义/Qwen、通义听悟,以及 Qoder 生态。
- 腾讯:腾讯元宝、混元、CodeBuddy、ima、WorkBuddy。
- 月之暗面:Kimi。
- DeepSeek:DeepSeek 助手、模型与 API。
- MiniMax:海螺 AI、MiniMax API,以及文本、视频、语音和音乐产品线。
- 得到 / 北京思维造物信息科技股份有限公司:得到大脑(原 Get 笔记)、得到 App 相关知识服务与 AI 记录能力。
- 快手:可灵 Kling。
- 百度、科大讯飞、智谱:分别形成文心/ERNIE、星火、GLM 等产品与模型生态。
4.9 AI 工具选型顺序
- 先定任务:写作/推理、搜索研究、代码、图像、视频、会议、自动化还是企业业务。
- 再看产品公司:账户、合同、支持、数据处理方、地区可用性和迁移风险由产品公司决定。
- 核对底层模型:工具可能自有模型、接入多家模型,或根据任务自动路由;不要只看产品宣传名称。
- 检查数据边界:是否上传敏感信息,是否支持私有化、本地部署、企业权限和审计日志。
- 测试真实样本:用自己的任务比较质量、稳定性、速度、成本、引用、可控性和导出能力。
- 保留迁移能力:提示词、知识库、工作流、生成内容和运行记录是否可以导出。
4.10 已有工具实践与延伸入口
这里集中挂接已有的产品笔记和使用记录。任务方法放在第二部分,MCP、Skills 和 Agent 的扩展机制放在第五部分。
4.10.1 搜索、研究与知识管理工具
- NotebookLM(2025 年入门笔记):资料库研究与知识卡片实践。
- NotebookLM 原始笔记
- ima-copilot:腾讯 AI 工作台(历史笔记):IMA 知识库与搜读写工作台实践。
- ima 原始笔记
- 将任意网页以知识库的方式接入「得到大脑」:得到大脑的知识库与 AI 搜索实践。
- 秘塔 APP(历史体验笔记)
- 通义千问工具与模型入口
- iAsk.ai 使用记录
- 使用 HyperLink 作为 Obsidian 的 AI 助手
- 如何使用夸克 AI 进行课程学习
- AI神器大全|AI工具集合导航站
- AI工具集官网|1000+ AI工具集合
4.10.2 编程、IDE 与 CLI 工具
- Codex(AI维护版):代码 Agent 工作台实践。
- Codex 原始笔记
- Codex 会话丢失与恢复实战
- Claude Code 能干嘛?:终端代码 Agent 使用场景。
- 如何安装 Claude Code
- Claude Code 能干嘛
- 安装 Gemini CLI
- iFlow CLI
- CodeBuddy 与 Claude Code 调研报告
- AI 编程与对话工具 Canvas
- Cursor
- TRAE
4.10.3 媒体、图像、视频与语音工具
- 海螺 AI(历史体验笔记):MiniMax 媒体生成产品的个人体验。
- Nano Banana
- Nano-Banana 创意提示词大集合
- 个人 IP 文章配图工作流
- 让个人 IP 进入文章配图
- 生成了 10,000 个 AI 视频后我所学到的知识
- 闪电说语音输入
4.10.4 自动化、Agent 与业务工作台
-
WorkBuddy 官网:腾讯全场景 AI 办公工作台与 Agent 能力入口。
-
当前市场地图、公司归属和来源清单已作为研究配套材料保存,后续按工具变化更新。
五、MCP与Skills
MCP 与 Skills 是 AI 的能力扩展层(截至 2026.08.24)
- **MCP(Model Context Protocol)**是开放协议,解决“AI 如何连接外部工具、数据和提示模板”;它起源于 Anthropic,但不属于某一个商业产品。
- **Skills(AI 技能)**是可复用的任务知识、操作流程、脚本、参考资料和模板,解决“AI 如何稳定完成一类任务”。当前 Agent Skills 已形成开放规范,最小单元通常是包含
SKILL.md的目录。- Agent/Host负责规划、选择和执行;MCP Server负责暴露外部能力;Plugin/Marketplace负责组合、发现、安装和分发。
- 最好记的一句话:Agent 决定何时做,Skill 规定怎么做,MCP 提供能做什么,模型负责理解与生成,用户负责授权与验收。
- 本机研究包(PNG、PDF、研究说明、来源清单):
/Users/bairimengyushi/Downloads/MCP与Skills/
- 已安装 Skills 的编号索引与逐项说明:Skills索引。
5.1 先分清五个层次
| 层次 | 解决什么问题 | 代表对象 | 典型归属 |
|---|---|---|---|
| 模型 | 理解、推理和生成 | GPT、Claude、Gemini、Qwen | 模型公司 |
| Agent/Host | 规划任务、调用能力、请求审批 | Claude Code、Codex、Cursor、WorkBuddy | AI 产品公司 |
| Skills | 固化领域知识、任务流程和验收标准 | SKILL.md、脚本、模板、参考资料 | 开放规范 + 客户端实现 |
| MCP | 统一连接外部工具、资源和提示 | JSON-RPC、Tools、Resources、Prompts | 开放协议生态 |
| Plugin/Marketplace | 打包、发现、安装、升级和治理 | Agent Plugins、MCP Registry、Smithery、Docker Catalog | 标准组织、平台公司或社区 |
5.2 MCP 是什么:让 AI 接入外部世界
MCP 采用 Host—Client—Server 结构。Claude Code、Codex、Cursor、VS Code、Gemini CLI、WorkBuddy 等可以作为 Host;Host 内部的 MCP Client 连接一个或多个 MCP Server;Server 再把具体服务包装成标准能力。
| MCP 能力 | 作用 | 例子 |
|---|---|---|
| Tools | 可调用的动作,可能改变外部状态 | 搜索、创建任务、读写文件、发消息、执行查询 |
| Resources | 可读取的上下文或数据 | 文档、数据库记录、项目文件、网页内容 |
| Prompts | Server 提供的提示模板或入口 | 研究模板、代码审查模板、带参数的命令 |
常见部署方式:
- stdio:Host 在本地启动 MCP Server 进程,适合文件、脚本、数据库和开发工具;便利但要警惕本地代码执行权限。
- Streamable HTTP:连接远程或容器化 Server,适合 SaaS 和团队服务;涉及用户数据时要核验 OAuth、PKCE 和权限范围。
- SSE:较早的远程传输方式,旧项目仍可能使用;新项目先看 Server 和客户端的官方推荐。
5.3 MCP Server 按能力分类
| 类别 | 代表性连接对象 | 典型用途 |
|---|---|---|
| 网页与搜索 | 搜索引擎、Fetch、Playwright、浏览器 | 检索网页、抓取资料、操作页面 |
| 文件与知识库 | 本地文件、Notion、数据库、向量库 | 读写资料、知识问答、查询记录 |
| 开发协作 | GitHub、GitLab、Linear、Sentry、终端 | Issue、代码、测试、部署和错误分析 |
| 办公协作 | 邮件、日历、飞书、Slack、Teams | 查询日程、创建任务、发送消息 |
| 媒体与内容 | 图像、音频、视频、PDF、演示文稿服务 | 生成、转换、分析和发布内容 |
| 业务系统 | CRM、客服、ERP、广告和内部 API | 读取业务数据、执行流程和自动化 |
| 编排与治理 | 聚合器、工具搜索、网关、日志和权限系统 | 减少工具数量、动态发现、审计调用 |
已有资料:
- MCP 项目合集
- Notion MCP
- Claude Code 调用飞书 MCP
- mcp-dayone 使用指南
- 滴答清单 MCP 性能优化实战
- AI 操控浏览器:bb-browser、Playwright、Browser-Agent
5.4 MCP 生态与公司/组织归属
| 对象 | 公司/组织 | 在生态中的位置 | 归属判断 |
|---|---|---|---|
| MCP Specification | modelcontextprotocol 社区,起源于 Anthropic | 协议、SDK、注册表和参考实现 | 开放协议生态,不是单一 SaaS |
| Official MCP Registry | MCP 生态官方注册表,参与者包括 Anthropic、GitHub、Microsoft 等 | 公共 Server 元数据、命名空间和发现 API | 官方注册表仍处于 Preview,不代表安全审计 |
| Smithery | Smithery | MCP Server 市场、托管连接和 OAuth/凭据服务 | 第三方市场,不等于协议所有者 |
| Glama | Glama | MCP Server 目录、托管与网关 | 第三方目录,条目需自行核验 |
| Docker MCP Catalog | Docker | 版本化、容器化、带 SBOM 的 Server 目录 | Beta;容器降低环境冲突,不等于工具无风险 |
| Agent Plugins | 开放标准社区;Cursor、VS Code、CodeBuddy 等采用 | 以插件打包 Skills 与 MCP 配置 | 分发/配置层,不替代 MCP 协议 |
| 扣子 / Coze | 北京春田知韵科技有限公司及关联方(与字节/飞书生态相关) | 内置 MCP Client,可基于 MCP 创建插件,也可把应用发布为 MCP 工具 | Agent、插件、工作流与 MCP 平台 |
主要 Host 的实现:
- Claude Code MCP:Anthropic 的终端 Agent,可连接本地和远程 Server。
- Codex Skills:OpenAI 的代码 Agent/工作台,使用带指令、脚本和资源的 Skills。
- ChatGPT 自定义 MCP:OpenAI 的远程 MCP/自定义 MCP Apps,完整写操作受产品模式和账号权限影响。
- Cursor MCP 与 Cursor Skills:Anysphere 的 AI IDE,支持 MCP 和 Agent Skills。
- VS Code MCP Server 与 GitHub Copilot Agent Skills:Microsoft/GitHub 开发工具生态。
- Gemini CLI MCP:Google 的终端工具,支持 MCP 管理和 Skills 命令。
- WorkBuddy/CodeBuddy MCP 与 Skills:腾讯/腾讯云的办公与代码 Agent,支持作用域、审批和工具级权限。
- Dify 双向 MCP:LangGenius 的 AI 应用平台,既能调用外部 MCP,也能把 Dify 应用/工作流暴露成 MCP Server。
- 扣子基于 MCP 创建插件 与 发布为 MCP 工具:扣子内置 MCP Client,可把外部 MCP 封装为插件,也可把自己的应用发布成 MCP 工具;官方主体为北京春田知韵科技有限公司及关联方。
判断“某个 MCP 属于哪个公司”时,至少分开看:协议维护者、Server 开发者、Server 托管者、底层数据/动作提供者。一个社区 Server 出现在某个市场里,并不等于它由该市场开发或审计。
5.5 Skills 是什么:把任务方法装进 Agent
Agent Skills 开放规范的最小结构通常是:
skill-name/
├── SKILL.md # 必需:元数据 + 指令
├── scripts/ # 可选:可执行脚本
├── references/ # 可选:按需加载的长资料
└── assets/ # 可选:模板、图片、字体、样例SKILL.md 的核心通常是 name 和 description,正文写任务边界、操作步骤、工具调用规则、输出格式和验收标准。Skills 的关键机制是渐进披露:先发现名称/描述,任务匹配后再加载全文,必要时再读取 references/assets 或执行脚本。
Skills 的五种常见类型:
- 知识型:行业术语、背景知识、判断标准和常见误区。
- 流程型:研究、写作、审校、发布、复盘等可重复步骤。
- 工具型:规定何时调用 MCP、CLI、浏览器或本地脚本。
- 格式型:把输入转换为 Markdown、PDF、表格、幻灯片、图像等。
- 治理型:来源核验、隐私处理、权限边界、质量检查和失败回退。
5.6 Skills 的生态与公司/产品实现
| 产品/生态 | 公司/组织 | Skills 形态 | 可移植性提示 |
|---|---|---|---|
| Agent Skills | 开放标准,最初由 Anthropic 推动 | SKILL.md + 可选脚本/资源 | 基础格式可跨兼容 Agent;扩展字段需实测 |
| Claude Code | Anthropic | 自动调用、手动 /skill、子代理和调用控制 | 支持标准并有 Claude 专属扩展 |
| Codex | OpenAI | Skill 文件夹、脚本、references、assets;也有 API Skills 资源 | 适合放在项目或用户级目录 |
| Cursor | Anysphere | .cursor/skills、.agents/skills、插件 | 支持多层目录和 Agent Plugins |
| GitHub Copilot / VS Code | GitHub / Microsoft | 项目级、个人级 Agent Skills,可通过 gh skill 发现 | 适合团队随代码库版本管理 |
| Gemini CLI | gemini skills 的安装、链接、启用和禁用 | 需要按 CLI 版本核验路径与命令 | |
| WorkBuddy / CodeBuddy | 腾讯 / 腾讯云 | .codebuddy/skills、市场/本地导入、插件、工具白名单 | 与 Agent Skills 相似,但扩展字段有产品差异 |
| 扣子 / Coze | 北京春田知韵科技有限公司及关联方 | Agent、插件、工作流和技能;同时支持 MCP 插件 | 产品内“技能”不自动等于 Agent Skills 开放规范 |
| 苏苏知识库 | 个人工作区 | .agents/skills 与本地 Skill 目录 | 以跨客户端兼容和可审查为优先 |
已有资料:
- 什么是 Skills,什么是 Agent?
- Skills、Agent、Commands、Plugins 概念
- Skill(AI技能)
- 什么是 Skills?它和提示词、SOP 有什么区别?
- 如何准确地调用 Skills?
- Skill-creator:技能创建指南
- Claude Code Skills 快速参考
- Claude Skills 说明
- Planning with Files
- 项目管理 Skill:用 Notion 承载活项目
- OneNote 导出备份 Skill
- B站视频图解笔记长图 Skill
- CFlow-Brain Skill
- NotebookLM Skills 对比分析
- 苏苏商业模式分析 Skills 搭建思路
- Canvas updater Skill
Agent Host 与 Skills 的使用记录:
- Claude Agent
- 智慧库管家说明文档
- Claude Code 官方 Telegram Channels
- Claude Code 远程操作完整指南
- 在 Obsidian 中使用 Claude Code
- 使用 Claude Code Router 切换模型
- Kimi K2 接入 Claude Code
- Claude Code 调用飞书 MCP
- Codex 公益中转站合集(时效性资源,使用前核验)
5.7 MCP、Skills、Prompt、SOP、Plugin、Agent 的边界
| 名词 | 主要回答的问题 | 示例 |
|---|---|---|
| Prompt | 这一次如何表达任务 | “请研究 MCP,并给出来源” |
| SOP | 人或团队固定怎么做 | 先检索、再交叉验证、再发布 |
| Skill | Agent 如何把一类任务稳定做完 | 研究→证据分级→结构化→画图→验收 |
| MCP Server | Agent 能连接什么外部能力 | Playwright、Notion、GitHub、数据库 |
| Plugin | 如何把多个扩展打包分发 | Skill + MCP + Hook + Agent |
| Agent | 谁来规划、选择、调用和执行 | Claude Code、Codex、WorkBuddy |
最实用的组合是:**Agent 负责判断,Skill 负责方法,MCP 负责连接,模型负责推理,用户负责授权与验收。**例如本次研究中,research-to-diagram 是任务方法,agent-reach 是检索与来源路由,浏览器/文件/图像等 MCP 能力负责执行外部动作。
5.8 选择与安全检查
- 先只读、后写入:搜索、读取、分析稳定后,再开放发消息、改数据库、删除文件、发布内容等写操作。
- 检查来源与代码:优先官方 Server、官方组织仓库或可信企业仓库;第三方市场用于发现,不替代代码审查。
- 区分本地与远程:stdio 可能执行本机代码;远程 HTTP 可能接触账号、请求内容和工具结果。
- 最小权限:核对 OAuth scope、API key、工作区权限、允许工具列表和项目/用户作用域。
- 审查 Skill:认真阅读
SKILL.md、scripts/、依赖包、安装钩子和环境变量;Skill 也可能诱导 Agent 越权。 - 防提示注入和工具投毒:网页、文档、MCP 返回内容都应视为不可信输入;高风险动作必须人工确认。
- 固定版本并验收:记录版本/commit,用固定样例测试发现准确率、执行成功率、结果可验证性和隐私风险。
5.9 推荐学习路径
- 先读 什么是 Skills,什么是 Agent? 和本节的分层表,建立名词边界。
- 在已有 Host 中连接一个只读 MCP Server,例如网页、Notion 或文件检索。
- 使用现成 Skill 完成一次固定任务,观察它如何发现、加载、调用工具和验收。
- 为自己的高频任务创建一个最小
SKILL.md,再逐步加入 references、脚本和模板。 - 把 Skill 与 MCP 配置打成插件或团队模板,加入权限审批、版本固定、日志和回退方案。
- 通过重复任务评估是否真的减少错误、上下文消耗和人工操作,再决定是否开放写权限。
5.10 研究来源与维护边界
- MCP 官方介绍 · MCP 基础规范 · 官方注册表
- Agent Skills 规范 · Claude Code Skills · OpenAI Codex Skills
- Cursor Skills · GitHub Copilot Agent Skills · Agent Plugins 规范
- WorkBuddy MCP · WorkBuddy Skills · Dify 双向 MCP · 扣子 MCP 插件
- 完整研究说明、来源清单和关系图已保存到本机:
/Users/bairimengyushi/Downloads/MCP与Skills/。
MCP 规范、客户端功能、Skills 目录、产品套餐、市场条目和授权方式变化很快。本节负责建立稳定的分类与判断框架;具体安装前,回到对应产品官方文档核验版本、权限、数据边界和地区可用性。
待处理:
— 国务院关于深入实施“人工智能+”行动的意见 (这个是政策了解即可)
-
1.5 AI的边界与结果校验
-
新增内容:幻觉、来源核验、隐私与安全、模型能力边界。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…