AI关键词清单 — 术语解释
说明
本文为 快速入行SOP — AI应用开发/Agent开发行动清单 中 100 个关键词的术语速查手册,按概念域分组,每条包含一句话释义和关键要点。
LLM 基础

Transformer 2017 年提出的深度学习架构,通过自注意力机制并行处理序列数据,是 GPT、Claude 等大语言模型的底层基础。取代了此前 RNN/LSTM 的串行处理方式。
自注意力机制(Self-Attention) Transformer 的核心组件。让序列中的每个位置直接关注其他所有位置,计算它们之间的关联权重,从而捕获长距离依赖关系。复杂度 O(n²)。
Token 模型处理文本的最小单位。一个 Token 大约对应 0.75 个英文单词或 0.5-1 个中文字符。"Hello world" 大约是 2 个 Token。模型的计费和上下文窗口都以 Token 为单位。
Context Window(上下文窗口) 模型单次能处理的最大 Token 数量。Claude Sonnet 约 200K tokens。超出部分会被截断或需要分段处理。直接影响模型能"记住"多少信息。
Temperature 控制模型输出随机性的参数,范围 0-1。值越低输出越确定(适合代码/事实问答),值越高输出越多样(适合创意写作)。通常设为 0-0.3 用于精确任务。
Top-P(核采样) 另一种控制输出随机性的方法。只从概率累计前 P 的候选词中采样。Top-P = 0.1 表示只考虑概率前 10% 的词。与 Temperature 互补使用。
Embedding(嵌入) 将文本转换为高维向量(如 1536 维)的表示方法。语义相近的文本在向量空间中距离更近。是 RAG、语义搜索、聚类等应用的基础。
Fine-tuning(微调) 在预训练模型基础上,用特定领域数据继续训练,使模型适配特定任务。需要少量高质量数据(几百到几千条)和一定的 GPU 资源。
SFT(Supervised Fine-Tuning,监督微调) Fine-tuning 的一种形式,使用"输入-期望输出"配对数据训练模型模仿特定行为模式。是让通用模型学会特定格式输出的主要方法。
RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习) 通过人类对模型输出的偏好排序训练奖励模型,再用强化学习优化主模型。是让模型输出更安全、更有用的关键对齐技术。
GRPO(Group Relative Policy Optimization,组相对策略优化) DeepSeek 提出的 RLHF 替代方案。不需要单独训练奖励模型,而是通过组内比较来优化策略。训练成本更低,效果接近。
推理优化(Inference Optimization) 降低模型推理延迟和成本的技术集合,包括 KV Cache、Flash Attention、投机解码、模型并行等。目标是让模型响应更快、更便宜。
量化(Quantization) 将模型权重从高精度(FP16/FP32)压缩到低精度(INT8/INT4),减少内存占用和推理成本。GGUF、AWQ、GPTQ 是常见量化格式。精度损失通常可接受。
幻觉(Hallucination) 模型生成看似合理但实际不正确的信息。这是 LLM 的固有缺陷,根源在于模型是概率生成而非检索事实。RAG、引用验证是主要缓解手段。
Few-shot / Zero-shot Few-shot:在提示中给模型几个示例再让其完成任务;Zero-shot:不给示例直接让模型完成。Few-shot 通常效果更好,但会消耗更多 Context Window。
Agent 核心
ReAct 范式 Thought → Action → Observation 循环。模型先推理(Thought),再执行工具(Action),观察结果(Observation),然后继续推理。是最常用的 Agent 模式。
Plan-and-Solve 范式 先完整规划再逐步执行的两阶段模式。模型先分解任务为子步骤列表,然后按顺序执行。适合复杂多步骤任务,但灵活性不如 ReAct。
Reflection 范式 Agent 回顾自身输出并自我修正的机制。模型完成任务后评估结果质量,发现问题则重新执行。能显著提高输出质量,但增加 Token 消耗。
Tool Use(工具调用) LLM 调用外部工具(API、数据库、搜索引擎等)扩展自身能力。模型本身只生成文本,通过工具才能与真实世界交互。
Function Calling Tool Use 的具体实现方式。模型输出结构化的函数调用请求(函数名 + 参数),由宿主程序执行后返回结果。OpenAI 和 Anthropic 各有自己的实现规范。
Agent Loop Agent 的核心运行循环:接收输入 → 推理决策 → 调用工具 → 观察结果 → 继续推理或输出结果。循环持续到任务完成或达到停止条件。
Harness Engineering(脚手架工程) 围绕 Agent 核心循环搭建的测试和评估基础设施。包括输入注入、输出捕获、中间状态检查、回归测试等。确保 Agent 行为可预测、可调试。
Multi-Agent(多智能体) 多个 Agent 协作完成任务的架构。每个 Agent 可有不同角色和专长,通过编排器协调。典型模式:主 Agent 分派子任务给专家 Agent。
Agent 通信 Multi-Agent 系统中 Agent 之间传递信息的方式。包括直接消息传递、共享状态、事件总线等。通信协议的选择影响系统的解耦程度和扩展性。
自主决策(Autonomous Decision) Agent 在没有人类干预的情况下自行判断下一步行动的能力。是 Agent 与简单工具链的核心区别。需要平衡自主性与可控性。
规划器(Planner) 负责将复杂任务分解为可执行步骤的组件。可以是 LLM 本身(通过提示实现),也可以是独立的规划模块。输出通常是任务树或步骤序列。
观察循环(OODA Loop) Observe-Orient-Decide-Act 的循环模式。源自军事决策理论,被 Agent 系统借鉴。Agent 持续感知环境(Observe)、理解状态(Orient)、做出决策(Decide)、执行动作(Act)。
子代理(Sub-agent) 在 Multi-Agent 架构中,由主 Agent 创建和管理的下级 Agent。负责执行特定子任务,完成后将结果汇报给主 Agent。类似进程与线程的关系。
编排(Orchestration) 协调多个 Agent 或工具按特定流程执行的过程。编排器负责任务分发、依赖管理、错误处理和结果聚合。是 Multi-Agent 系统的"指挥家"。
状态管理 维护 Agent 在多步骤任务中的上下文和中间状态。包括对话历史、工具调用结果、用户偏好等。状态管理的质量直接影响 Agent 的连贯性。
失败恢复(Failure Recovery) Agent 在工具调用失败、模型输出异常等情况下的容错机制。包括重试、降级策略、回滚到安全状态等。生产环境 Agent 的必备能力。
Guardrails(安全护栏) 限制 Agent 行为范围的安全机制。包括输入过滤(防止注入攻击)、输出校验(防止泄露敏感信息)、行为边界(限制可调用的工具和操作)。确保 Agent 在安全范围内行动。
Agentic Workflow(智能体工作流) 以 Agent 为核心的工作流程设计。区别于传统固定流程,Agentic Workflow 允许 AI 在关键节点做出决策。工作流可以是完全自主或人机协作的。
Vibe Coding 以 AI 为主力编写代码的开发方式。开发者描述意图,AI 生成代码,开发者审查和调整。强调"感受"而非逐行编写。术语由 Andrej Karpathy 提出。
AI 驱动开发 将 AI 深度集成到软件开发全流程的范式。从需求分析、代码编写、测试到部署,AI 在每个环节辅助或主导。Vibe Coding 是其在编码环节的具体体现。
上下文工程
Context Engineering(上下文工程) 系统性地设计、管理和优化输入给模型的所有上下文信息的工程学科。比 Prompt Engineering 范围更广,涵盖检索策略、信息压缩、状态管理等。Anthropic 认为这是构建 Agent 的核心技能。
Prompt Engineering(提示工程) 设计和优化提示词以引导模型输出期望结果的技术。是 Context Engineering 的子集。包括角色设定、示例提供、格式约束、思维链引导等技巧。
RAG(Retrieval-Augmented Generation,检索增强生成) 在生成回答前先从外部知识库检索相关信息,将检索结果注入提示中供模型参考。是解决模型知识过时和幻觉问题的主要方案。
向量数据库 存储和查询 Embedding 向量的专用数据库。支持相似度搜索(找到语义最接近的结果)。主流产品:Chroma、Pinecone、Milvus、FAISS、Weaviate。
Contextual Retrieval(上下文化检索)Anthropic 提出的检索优化方法。在生成 Embedding 前,先让 LLM 为每个文档块补充上下文摘要,使检索结果在脱离原文时仍能保持语义完整性。
GSSC 管线(Gather / Select / Structure / Compress) 上下文工程的四步流水线:收集(Gather)候选信息 → 筛选(Select)相关内容 → 组织(Structure)逻辑结构 → 压缩(Compress)去除冗余。确保模型在有限 Context Window 内获得最高质量的信息。
记忆系统(Memory System) 让 Agent 跨会话保留信息的能力。分为短期记忆(当前对话上下文)和长期记忆(用户偏好、历史摘要)。类比人类的工作记忆和长期记忆。
Chunking(分块) 将长文档切分为较小片段的策略。影响 RAG 的检索粒度。块太小丢失上下文,太大引入噪声。常见策略:固定长度、语义切分、递归切分。
BM25 经典的稀疏检索算法,基于词频和文档频率计算相关性。不依赖 Embedding,计算成本低。通常与向量检索混合使用(Hybrid Search)以提升召回率。
Think Tool 让模型在执行动作前显式生成一段内部"思考"的工具。不是让模型推理,而是提供一个 scratchpad 让模型组织信息、检查约束、规划步骤。Anthropic 推荐用于复杂任务。
Context Window 管理 在有限上下文窗口中合理分配信息的策略。包括:截断旧消息、摘要压缩、优先级排序、滑动窗口等。目标是确保最重要的信息始终在窗口内。
检索失败率 RAG 系统未能检索到相关信息的比例。是衡量检索质量的核心指标。高检索失败率直接导致模型回答质量下降。可通过优化 Embedding 模型、调整 Chunking 策略、混合检索来降低。
协议与工具
MCP(Model Context Protocol,模型上下文协议) Anthropic 提出的开放协议,标准化 AI 模型与外部工具/数据源的交互方式。类似 USB 协议统一外设接入,MCP 统一了 Agent 的工具调用接口。
A2A(Agent-to-Agent) Google 提出的 Agent 间通信协议。让不同框架、不同厂商构建的 Agent 能互相发现和协作。关注点在 Agent 之间的交互标准。
ACP(Agent Communication Protocol) 另一种 Agent 通信协议提案。与 A2A 定位类似但设计理念不同,更侧重消息格式和传输层的标准化。目前生态尚未成熟。
MCP Server 暴露工具和数据能力的服务端,遵循 MCP 协议规范。每个 MCP Server 提供一组工具(如文件读写、数据库查询、API 调用),供 MCP Client 调用。
MCP Client 发起 MCP 调用的客户端。通常嵌入在 AI 应用或 Agent 框架中,负责发现 MCP Server 提供的工具、发送调用请求、接收结果。
工具发现(Tool Discovery) Agent 动态感知可用工具的机制。MCP 协议中,Client 连接 Server 后自动获取其提供的工具列表和能力描述,无需预先硬编码。
Code Execution 让 AI 模型在沙箱环境中执行代码的能力。模型生成代码 → 沙箱运行 → 返回结果。用于数据分析、代码生成验证、自动化任务等场景。
Desktop Extensions MCP 协议中的桌面端扩展机制。允许 MCP Server 访问本地桌面能力(文件系统、剪贴板、窗口操作等)。需要用户显式授权。
.mcpb 扩展包 MCP 的打包分发格式。将 MCP Server 及其依赖打包为单个文件,方便安装和分享。类似 npm 包或浏览器扩展的安装体验。
LangChain 最流行的 LLM 应用开发框架。提供链式调用抽象,将 Prompt、LLM、工具、记忆等组件串联为完整应用。适合快速原型,但复杂场景下抽象层级可能过重。
LangGraph LangChain 团队推出的有向图编排框架。将 Agent 工作流建模为状态图(节点 = 处理步骤,边 = 条件分支),更适合复杂的多步骤 Agent 系统。
Dify 开源 LLM 应用开发平台。提供可视化界面搭建 Agent 和 RAG 应用,支持工作流编排、模型管理、知识库管理。适合非工程师快速搭建 AI 应用。
Coze 字节跳动推出的 AI 应用开发平台。提供可视化 Agent 构建工具,内置插件市场和工作流编排。面向国内市场,支持多种国产模型。
评估与质量
Eval(Evaluation,评估) 系统性地评估 AI 系统输出质量的过程。包括自动评估(用指标或 LLM-as-Judge)和人工评估。是 Agent 迭代优化的基础——没有测量就没有改进。
SWE-Bench 评估 LLM 代码修复能力的基准测试。包含真实 GitHub Issue 和对应 PR,要求模型在给定代码库中定位并修复 Bug。是衡量编程 Agent 能力的核心指标。
BrowseComp 评估 AI 网页浏览和信息提取能力的基准测试。测试 Agent 在真实网页中查找、理解、整合信息的能力。
基准噪声(Benchmark Noise) 基准测试结果中的随机波动。同一模型多次跑同一基准,分数可能差异显著。导致排名不稳定,不应过度依赖单一基准分数做决策。
评估污染(Evaluation Contamination) 测试数据意外出现在训练数据中,导致基准分数虚高。模型"记住"了答案而非真正学会了能力。是当前 LLM 评估面临的主要挑战之一。
AI 抗性评估(Adversarial Eval) 专门用对抗性输入测试模型鲁棒性的评估方法。包括越狱尝试、注入攻击、边缘情况等。确保模型在被恶意使用时仍能保持安全行为。
黄金数据集(Golden Dataset) 由专家人工标注的标准测试集。作为评估的"金标准",用于校准自动评估指标的准确性。质量高但成本高,通常规模较小。
Human Eval 人工评估模型输出的方法。评估者根据预设标准对输出打分或排序。是最可靠的评估方式,但速度慢、成本高,难以大规模使用。
Agent 性能测试 评估 Agent 在多步骤任务中表现的方法。关注指标:任务完成率、步骤数、Token 消耗、工具调用成功率、错误恢复能力等。
端到端评估(End-to-End Eval) 以最终业务指标衡量整个系统表现的评估方式。不关注中间步骤是否正确,只看最终输出是否满足用户需求。最接近真实使用场景的评估方法。
工程化
API 设计 定义 AI 服务的接口规范。包括端点设计、请求/响应格式、认证方式、速率限制、错误码等。AI 应用的 API 设计需要特别考虑流式响应和异步调用。
FastAPI Python 的高性能 Web 框架,自动生成 OpenAPI 文档。内置异步支持、类型校验、依赖注入。是构建 AI 服务 API 的首选框架。
Docker 容器化 将应用及其依赖打包为标准化容器,确保在任何环境一致运行。AI 应用容器化的挑战:GPU 驱动兼容、模型文件体积大、内存需求高。
流式输出(Streaming) 逐 Token 返回模型输出,而非等待完整响应。大幅改善用户感知延迟。SSE(Server-Sent Events)是常用传输协议。
异步调用 不阻塞主线程发起 LLM 请求,通过回调或协程处理结果。高并发场景下的必备模式。Python 的 async/await 是主要实现方式。
负载均衡 在多个模型实例间分摊请求。策略包括轮询、最少连接、基于延迟等。对 AI 服务尤为重要,因为单次推理耗时长、资源占用高。
缓存策略 缓存重复或相似请求的模型响应。包括精确匹配缓存和语义相似缓存(用 Embedding 判断)。可显著降低延迟和成本。
监控与日志 收集和分析 AI 服务的运行时数据。关键指标:请求延迟、Token 消耗、错误率、缓存命中率。日志应包含完整的输入输出对以支持调试和审计。
系统设计 从全局视角规划 AI 应用的架构。包括组件划分、数据流、扩展策略、容错机制等。面试高频考点,需要能画出架构图并解释各组件职责。
CI/CD(持续集成/持续部署) 自动化构建、测试和部署流水线。AI 应用的 CI/CD 额外需要:Prompt 版本管理、Eval 自动运行、模型 A/B 测试、灰度发布。
沙箱(Sandboxing) 隔离执行环境,防止 AI 生成的代码或操作影响宿主系统。方法包括 Docker 容器、WebAssembly、虚拟机等。Code Execution 的安全基础。
权限管理 控制 Agent 能访问哪些资源和执行哪些操作。遵循最小权限原则。包括工具级权限(能调用哪些工具)和数据级权限(能访问哪些数据)。
错误处理 处理 AI 应用中各类异常的策略。包括模型调用失败、工具超时、输出格式错误、内容安全违规等。需要优雅降级而非直接崩溃。
多模型协作 组合多个模型完成复杂任务。模式包括:路由(根据任务选模型)、级联(一个模型的输出作为另一个的输入)、投票(多模型结果取一致)。
Prompt 管理 版本化管理提示词资产的实践。包括 Prompt 模板存储、A/B 测试、版本回滚、效果追踪。生产环境中 Prompt 是核心资产,需要像代码一样管理。
行业标准
LLMs.txt 为 AI 爬虫定义站点访问规范的文件。类似 robots.txt,但专门针对大模型的数据抓取需求。网站可通过此文件声明哪些内容可供 AI 训练/检索使用。
robots.txt 演进 robots.txt 从搜索引擎爬虫规范演进到 AI 时代的访问控制。传统 robots.txt 无法满足 AI 特有的需求(如训练 vs 检索的区分),催生了 LLMs.txt 等新标准。
Agentic RL 让 Agent 在与真实环境的交互中通过强化学习持续优化行为。区别于传统 RLHF 的离线训练,Agentic RL 在线学习,Agent 能从实际任务执行中积累经验。
超级个体 借助 AI 工具将个人能力大幅扩展的理念。一个人借助 Agent 完成原本需要团队才能完成的工作。是 AI 时代的工作方式愿景。
AI 应用工程师 将 AI 模型能力转化为可落地产品的工程师角色。核心能力:应用架构设计、Prompt Engineering、RAG 系统搭建、API 开发。不要求训练模型,但要求会用模型。
Agent 开发工程师 专注构建自主 Agent 系统的工程师角色。核心能力:Agent 架构设计、工具集成、编排逻辑、状态管理、评估优化。比 AI 应用工程师更侧重 Agent 范式。
LLM Engineer 深耕大模型本身的工程师角色。涉及模型训练、微调、推理优化、部署。需要深厚的机器学习背景。与 AI 应用工程师形成"造模型"vs"用模型"的分工。
MLOps 机器学习运维的实践体系。将模型生命周期(训练、评估、部署、监控、迭代)纳入工程化管理。是 DevOps 在 AI 领域的延伸。
推理工程师 专注优化模型推理性能的工程师。工作包括:模型压缩(量化/蒸馏)、推理引擎优化(TensorRT/vLLM)、服务架构设计。目标:更低延迟、更低成本、更高吞吐。
AI 产品化 将 AI 技术能力转化为可商用产品的全过程。包括:需求定义、技术选型、体验设计、合规审查、运营迭代。技术只是手段,产品化决定商业价值。
额外关键词
知识库(Knowledge Base) 为 RAG 系统提供外部知识的结构化数据集合。可以是文档、数据库、API 响应等。知识库的质量直接决定 RAG 系统的输出质量。
GUI Agent 能直接操控图形用户界面的 Agent。通过截图理解界面、模拟点击和输入完成操作。应用场景:自动化测试、RPA、辅助操作。挑战在于界面多样性和动态变化。
低代码平台 通过可视化拖拽方式构建 AI 应用的平台。降低了 AI 应用开发门槛,非工程师也能快速搭建。典型产品:Dify、Coze、Flowise。适合简单场景,复杂需求仍需代码开发。
NotebookLM Google 推出的 AI 知识助手产品。用户上传文档后,AI 基于这些文档回答问题、生成摘要。展示了"个人知识库 + AI"产品形态的潜力。
Anthropic Claude Anthropic 公司开发的大语言模型系列。以安全性和长上下文处理著称(200K Context Window)。在 Agent 开发、代码生成、内容分析等场景表现优秀。Claude Code 是其 CLI 工具。
组成段落
在大模型技术飞速演进的今天,理解从底层到应用的完整知识体系至关重要。Transformer 架构通过自注意力机制对序列中的每个 Token 建立全局关联,Context Window 决定了模型一次能"看到"多少信息;Temperature 与 Top-P 控制输出的随机性,Embedding 将语义压缩为向量空间中的坐标,而 Fine-tuning——尤其是 SFT(监督微调)——让通用模型适配特定场景;RLHF 通过人类反馈对齐价值观,GRPO 则进一步优化策略梯度,配合推理优化与量化(Quantization)将模型压缩至可部署规模;即便如此,幻觉(Hallucination) 依然是悬而未决的挑战,Few-shot / Zero-shot 提示策略则在无需重训的前提下激发模型的泛化能力。
构建智能体时,ReAct 范式 将推理与行动交织执行,Plan-and-Solve 范式 先拆解目标再逐步求解,Reflection 范式 让 Agent 回顾自身输出并自我修正;Tool Use(工具调用) 和 Function Calling 赋予 Agent 操控外部世界的手臂,整个 Agent Loop 在规划器(Planner) 的驱动下持续运转,遵循观察循环(Observe-Orient-Decide-Act) 的节奏感知环境、作出自主决策;Harness Engineering 负责搭建稳健的测试脚手架,Multi-Agent 系统将任务分发给若干子代理(Sub-agent),依托编排(Orchestration) 协调彼此,Agent 通信 协议保证消息可靠传递;状态管理 维护跨步骤的上下文一致性,失败恢复 机制在工具报错时优雅降级,Guardrails 划定安全边界,整套 Agentic Workflow 最终落地为Vibe Coding 式的流畅开发体验,推动 AI 驱动开发 成为新的工程范式。
上下文的质量决定输出的上限,Context Engineering 是比 Prompt Engineering 更系统的工程学科;RAG(检索增强生成) 将外部知识库实时注入模型,依赖向量数据库 存储语义索引,Contextual Retrieval 在检索时附带段落背景以提升相关性,GSSC 管线(Gather / Select / Structure / Compress) 系统化地收集、筛选、组织并压缩信息;记忆系统 跨会话沉淀用户偏好,Chunking 策略影响文档切分粒度,BM25 作为稀疏检索的经典基线与向量检索互补,Think Tool 让模型在行动前显式地"思考一步",Context Window 管理 避免超长输入截断关键信息,而降低检索失败率 则是保证端到端质量的核心指标。
协议层面,MCP(Model Context Protocol) 统一了工具接入标准,MCP Server 暴露能力、MCP Client 发起调用,工具发现 机制让 Agent 动态感知可用工具;A2A(Agent-to-Agent) 和 ACP(Agent Communication Protocol) 定义了智能体间的协作语言,Code Execution 沙箱让模型安全运行代码,Desktop Extensions 与 .mcpb 扩展包 将能力打包分发;LangChain 提供链式调用抽象,LangGraph 引入有向图编排复杂流程,Dify 和 Coze 则以低代码平台的形态让非工程师也能搭建 Agent 应用;结合 GUI Agent,模型甚至能直接操控图形界面完成任务,而 NotebookLM 展示了知识型 AI 产品的另一种形态。
评估体系同样不可或缺:Eval(评估) 是迭代优化的指南针,SWE-Bench 考验代码修复能力,BrowseComp 衡量网页浏览与信息提取水平;基准噪声 与评估污染 提醒我们榜单数字并不总是可信,AI 抗性评估 专门测试模型在对抗性输入下的鲁棒性,黄金数据集 和 Human Eval 提供人工标注的权威参照,Agent 性能测试 关注多步任务的成功率,端到端评估 则以真实业务指标检验整套系统的交付价值。
工程化落地需要一整套基础设施:API 设计 决定服务边界,FastAPI 快速构建高性能接口,Docker 容器化 保证环境一致性;流式输出(Streaming) 大幅改善用户感知延迟,异步调用 提升并发吞吐,负载均衡 在多实例间分摊请求,缓存策略 复用高频推理结果,监控与日志 让线上异常无所遁形;系统设计 阶段就需考虑沙箱(Sandboxing) 隔离和权限管理,错误处理 保证链路韧性,多模型协作 将不同专长的模型组合为更强的整体,Prompt 管理 平台则版本化维护提示词资产;CI/CD 流水线将上述一切持续集成交付,MLOps 将模型生命周期纳入工程化管理,推理工程师 专注于降低延迟与成本,为 AI 产品化 扫清最后一公里的障碍。
在行业标准演进上,LLMs.txt 为 AI 爬虫定义了站点级的访问规范,是 robots.txt 演进 在大模型时代的延伸;Agentic RL 让智能体在与环境的真实交互中强化学习,催生出能独当一面的超级个体;AI 应用工程师 负责将模型能力转化为产品价值,Agent 开发工程师 专注构建自主任务系统,LLM Engineer 深耕模型训练与微调;以 Anthropic Claude 为代表的前沿模型正在重新定义智能的边界——而掌握以上每一个词汇,正是在这场变革中站稳脚跟的起点。
参考引用
- 快速入行SOP — AI应用开发/Agent开发行动清单 — 对应的关键词清单原文
- AI领域全景地图 — Agent/应用开发求职视角 — AI 全景分层 + 技能树
- ../../02_AREAS/AI/wiki/concepts/Agent架构与编排 — Agent 设计模式 + MCP 协议
- ../../02_AREAS/AI/wiki/concepts/上下文工程 — GSSC 管线 + Contextual Retrieval
- ../../02_AREAS/AI/wiki/concepts/Agent基础与训练 — LLM 基础 + 三种范式
- ../../02_AREAS/AI/wiki/concepts/评估与基准 — Eval 方法论 + SWE-Bench
