---
url: /blog/kw-glossary/index.md
---
# 关键词清单 — 术语解释

> \[!NOTE] 说明
> 本文为 \[\[快速入行SOP-AI应用开发行动清单]] 中 100 个关键词的术语速查手册，按概念域分组，每条包含一句话释义和关键要点。

***

## LLM 基础

![844|844|844x764](./assets/AI关键词/image.png)

**Transformer**
2017 年提出的深度学习架构，通过自注意力机制并行处理序列数据，是 GPT、Claude 等大语言模型的底层基础。取代了此前 RNN/LSTM 的串行处理方式。

**自注意力机制（Self-Attention）**
Transformer 的核心组件。让序列中的每个位置直接关注其他所有位置，计算它们之间的关联权重，从而捕获长距离依赖关系。复杂度 O(n²)。

**Token**
模型处理文本的最小单位。一个 Token 大约对应 0.75 个英文单词或 0.5-1 个中文字符。"Hello world" 大约是 2 个 Token。模型的计费和上下文窗口都以 Token 为单位。

**Context Window（上下文窗口）**
模型单次能处理的最大 Token 数量。Claude Sonnet 约 200K tokens。超出部分会被截断或需要分段处理。直接影响模型能"记住"多少信息。

**Temperature**
控制模型输出随机性的参数，范围 0-1。值越低输出越确定（适合代码/事实问答），值越高输出越多样（适合创意写作）。通常设为 0-0.3 用于精确任务。

**Top-P（核采样）**
另一种控制输出随机性的方法。只从概率累计前 P 的候选词中采样。Top-P = 0.1 表示只考虑概率前 10% 的词。与 Temperature 互补使用。

**Embedding（嵌入）**
将文本转换为高维向量（如 1536 维）的表示方法。语义相近的文本在向量空间中距离更近。是 RAG、语义搜索、聚类等应用的基础。

**Fine-tuning（微调）**
在预训练模型基础上，用特定领域数据继续训练，使模型适配特定任务。需要少量高质量数据（几百到几千条）和一定的 GPU 资源。

**SFT（Supervised Fine-Tuning，监督微调）**
Fine-tuning 的一种形式，使用"输入-期望输出"配对数据训练模型模仿特定行为模式。是让通用模型学会特定格式输出的主要方法。

**RLHF（Reinforcement Learning from Human Feedback，人类反馈强化学习）**
通过人类对模型输出的偏好排序训练奖励模型，再用强化学习优化主模型。是让模型输出更安全、更有用的关键对齐技术。

**GRPO（Group Relative Policy Optimization，组相对策略优化）**
DeepSeek 提出的 RLHF 替代方案。不需要单独训练奖励模型，而是通过组内比较来优化策略。训练成本更低，效果接近。

**推理优化（Inference Optimization）**
降低模型推理延迟和成本的技术集合，包括 KV Cache、Flash Attention、投机解码、模型并行等。目标是让模型响应更快、更便宜。

**量化（Quantization）**
将模型权重从高精度（FP16/FP32）压缩到低精度（INT8/INT4），减少内存占用和推理成本。GGUF、AWQ、GPTQ 是常见量化格式。精度损失通常可接受。

**幻觉（Hallucination）**
模型生成看似合理但实际不正确的信息。这是 LLM 的固有缺陷，根源在于模型是概率生成而非检索事实。RAG、引用验证是主要缓解手段。

**Few-shot / Zero-shot**
Few-shot：在提示中给模型几个示例再让其完成任务；Zero-shot：不给示例直接让模型完成。Few-shot 通常效果更好，但会消耗更多 Context Window。

***

## Agent 核心

**ReAct 范式**
Thought → Action → Observation 循环。模型先推理（Thought），再执行工具（Action），观察结果（Observation），然后继续推理。是最常用的 Agent 模式。

**Plan-and-Solve 范式**
先完整规划再逐步执行的两阶段模式。模型先分解任务为子步骤列表，然后按顺序执行。适合复杂多步骤任务，但灵活性不如 ReAct。

**Reflection 范式**
Agent 回顾自身输出并自我修正的机制。模型完成任务后评估结果质量，发现问题则重新执行。能显著提高输出质量，但增加 Token 消耗。

**Tool Use（工具调用）**
LLM 调用外部工具（API、数据库、搜索引擎等）扩展自身能力。模型本身只生成文本，通过工具才能与真实世界交互。

**Function Calling**
Tool Use 的具体实现方式。模型输出结构化的函数调用请求（函数名 + 参数），由宿主程序执行后返回结果。OpenAI 和 Anthropic 各有自己的实现规范。

**Agent Loop**
Agent 的核心运行循环：接收输入 → 推理决策 → 调用工具 → 观察结果 → 继续推理或输出结果。循环持续到任务完成或达到停止条件。

**Harness Engineering（脚手架工程）**
围绕 Agent 核心循环搭建的测试和评估基础设施。包括输入注入、输出捕获、中间状态检查、回归测试等。确保 Agent 行为可预测、可调试。

**Multi-Agent（多智能体）**
多个 Agent 协作完成任务的架构。每个 Agent 可有不同角色和专长，通过编排器协调。典型模式：主 Agent 分派子任务给专家 Agent。

**Agent 通信**
Multi-Agent 系统中 Agent 之间传递信息的方式。包括直接消息传递、共享状态、事件总线等。通信协议的选择影响系统的解耦程度和扩展性。

**自主决策（Autonomous Decision）**
Agent 在没有人类干预的情况下自行判断下一步行动的能力。是 Agent 与简单工具链的核心区别。需要平衡自主性与可控性。

**规划器（Planner）**
负责将复杂任务分解为可执行步骤的组件。可以是 LLM 本身（通过提示实现），也可以是独立的规划模块。输出通常是任务树或步骤序列。

\==**观察循环（OODA Loop）**==
Observe-Orient-Decide-Act 的循环模式。源自军事决策理论，被 Agent 系统借鉴。Agent 持续感知环境（Observe）、理解状态（Orient）、做出决策（Decide）、执行动作（Act）。

**子代理（Sub-agent）**
在 Multi-Agent 架构中，由主 Agent 创建和管理的下级 Agent。负责执行特定子任务，完成后将结果汇报给主 Agent。类似进程与线程的关系。

**编排（Orchestration）**
协调多个 Agent 或工具按特定流程执行的过程。编排器负责任务分发、依赖管理、错误处理和结果聚合。是 Multi-Agent 系统的"指挥家"。

**状态管理**
维护 Agent 在多步骤任务中的上下文和中间状态。包括对话历史、工具调用结果、用户偏好等。状态管理的质量直接影响 Agent 的连贯性。

**失败恢复（Failure Recovery）**
Agent 在工具调用失败、模型输出异常等情况下的容错机制。包括重试、降级策略、回滚到安全状态等。生产环境 Agent 的必备能力。

**Guardrails（安全护栏）**
限制 Agent 行为范围的安全机制。包括输入过滤（防止注入攻击）、输出校验（防止泄露敏感信息）、行为边界（限制可调用的工具和操作）。确保 Agent 在安全范围内行动。

**Agentic Workflow（智能体工作流）**
以 Agent 为核心的工作流程设计。区别于传统固定流程，Agentic Workflow 允许 AI 在关键节点做出决策。工作流可以是完全自主或人机协作的。

**Vibe Coding**
以 AI 为主力编写代码的开发方式。开发者描述意图，AI 生成代码，开发者审查和调整。强调"感受"而非逐行编写。术语由 Andrej Karpathy 提出。

**AI 驱动开发**
将 AI 深度集成到软件开发全流程的范式。从需求分析、代码编写、测试到部署，AI 在每个环节辅助或主导。Vibe Coding 是其在编码环节的具体体现。

***

## 上下文工程

**Context Engineering（上下文工程）**
系统性地设计、管理和优化输入给模型的所有上下文信息的工程学科。比 Prompt Engineering 范围更广，涵盖检索策略、信息压缩、状态管理等。Anthropic 认为这是构建 Agent 的核心技能。

**Prompt Engineering（提示工程）**
设计和优化提示词以引导模型输出期望结果的技术。是 Context Engineering 的子集。包括角色设定、示例提供、格式约束、思维链引导等技巧。

**RAG（Retrieval-Augmented Generation，检索增强生成）**
在生成回答前先从外部知识库检索相关信息，将检索结果注入提示中供模型参考。是解决模型知识过时和幻觉问题的主要方案。

**向量数据库**
存储和查询 Embedding 向量的专用数据库。支持相似度搜索（找到语义最接近的结果）。主流产品：Chroma、Pinecone、Milvus、FAISS、Weaviate。

\==**Contextual Retrieval（上下文化检索）**==
\==Anthropic 提出的检索优化方法。在生成 Embedding 前，先让 LLM 为每个文档块补充上下文摘要，使检索结果在脱离原文时仍能保持语义完整性。==

\==**GSSC 管线（Gather / Select / Structure / Compress）**==
上下文工程的四步流水线：收集（Gather）候选信息 → 筛选（Select）相关内容 → 组织（Structure）逻辑结构 → 压缩（Compress）去除冗余。确保模型在有限 Context Window 内获得最高质量的信息。

**记忆系统（Memory System）**
让 Agent 跨会话保留信息的能力。分为短期记忆（当前对话上下文）和长期记忆（用户偏好、历史摘要）。类比人类的工作记忆和长期记忆。

**Chunking（分块）**
将长文档切分为较小片段的策略。影响 RAG 的检索粒度。块太小丢失上下文，太大引入噪声。常见策略：固定长度、语义切分、递归切分。

**BM25**
经典的稀疏检索算法，基于词频和文档频率计算相关性。不依赖 Embedding，计算成本低。通常与向量检索混合使用（Hybrid Search）以提升召回率。

\==**Think Tool**==
让模型在执行动作前显式生成一段内部"思考"的工具。不是让模型推理，而是提供一个 scratchpad 让模型组织信息、检查约束、规划步骤。Anthropic 推荐用于复杂任务。

**Context Window 管理**
在有限上下文窗口中合理分配信息的策略。包括：截断旧消息、摘要压缩、优先级排序、滑动窗口等。目标是确保最重要的信息始终在窗口内。

**检索失败率**
RAG 系统未能检索到相关信息的比例。是衡量检索质量的核心指标。高检索失败率直接导致模型回答质量下降。可通过优化 Embedding 模型、调整 Chunking 策略、混合检索来降低。

***

## 协议与工具

**MCP（Model Context Protocol，模型上下文协议）**
Anthropic 提出的开放协议，标准化 AI 模型与外部工具/数据源的交互方式。类似 USB 协议统一外设接入，MCP 统一了 Agent 的工具调用接口。

**A2A（Agent-to-Agent）**
Google 提出的 Agent 间通信协议。让不同框架、不同厂商构建的 Agent 能互相发现和协作。关注点在 Agent 之间的交互标准。

**ACP（Agent Communication Protocol）**
另一种 Agent 通信协议提案。与 A2A 定位类似但设计理念不同，更侧重消息格式和传输层的标准化。目前生态尚未成熟。

\==**MCP Server**==
暴露工具和数据能力的服务端，遵循 MCP 协议规范。每个 MCP Server 提供一组工具（如文件读写、数据库查询、API 调用），供 MCP Client 调用。

\==**MCP Client**==
发起 MCP 调用的客户端。通常嵌入在 AI 应用或 Agent 框架中，负责发现 MCP Server 提供的工具、发送调用请求、接收结果。

\==**工具发现（Tool Discovery）**==
Agent 动态感知可用工具的机制。MCP 协议中，Client 连接 Server 后自动获取其提供的工具列表和能力描述，无需预先硬编码。

**Code Execution**
让 AI 模型在沙箱环境中执行代码的能力。模型生成代码 → 沙箱运行 → 返回结果。用于数据分析、代码生成验证、自动化任务等场景。

**Desktop Extensions**
MCP 协议中的桌面端扩展机制。允许 MCP Server 访问本地桌面能力（文件系统、剪贴板、窗口操作等）。需要用户显式授权。

**.mcpb 扩展包**
MCP 的打包分发格式。将 MCP Server 及其依赖打包为单个文件，方便安装和分享。类似 npm 包或浏览器扩展的安装体验。

**LangChain**
最流行的 LLM 应用开发框架。提供链式调用抽象，将 Prompt、LLM、工具、记忆等组件串联为完整应用。适合快速原型，但复杂场景下抽象层级可能过重。

**LangGraph**
LangChain 团队推出的有向图编排框架。将 Agent 工作流建模为状态图（节点 = 处理步骤，边 = 条件分支），更适合复杂的多步骤 Agent 系统。

**Dify**
开源 LLM 应用开发平台。提供可视化界面搭建 Agent 和 RAG 应用，支持工作流编排、模型管理、知识库管理。适合非工程师快速搭建 AI 应用。

**Coze**
字节跳动推出的 AI 应用开发平台。提供可视化 Agent 构建工具，内置插件市场和工作流编排。面向国内市场，支持多种国产模型。

***

## 评估与质量

**Eval（Evaluation，评估）**
系统性地评估 AI 系统输出质量的过程。包括自动评估（用指标或 LLM-as-Judge）和人工评估。是 Agent 迭代优化的基础——没有测量就没有改进。

**SWE-Bench**
评估 LLM 代码修复能力的基准测试。包含真实 GitHub Issue 和对应 PR，要求模型在给定代码库中定位并修复 Bug。是衡量编程 Agent 能力的核心指标。

**BrowseComp**
评估 AI 网页浏览和信息提取能力的基准测试。测试 Agent 在真实网页中查找、理解、整合信息的能力。

**基准噪声（Benchmark Noise）**
基准测试结果中的随机波动。同一模型多次跑同一基准，分数可能差异显著。导致排名不稳定，不应过度依赖单一基准分数做决策。

**评估污染（Evaluation Contamination）**
测试数据意外出现在训练数据中，导致基准分数虚高。模型"记住"了答案而非真正学会了能力。是当前 LLM 评估面临的主要挑战之一。

**AI 抗性评估（Adversarial Eval）**
专门用对抗性输入测试模型鲁棒性的评估方法。包括越狱尝试、注入攻击、边缘情况等。确保模型在被恶意使用时仍能保持安全行为。

**黄金数据集（Golden Dataset）**
由专家人工标注的标准测试集。作为评估的"金标准"，用于校准自动评估指标的准确性。质量高但成本高，通常规模较小。

**Human Eval**
人工评估模型输出的方法。评估者根据预设标准对输出打分或排序。是最可靠的评估方式，但速度慢、成本高，难以大规模使用。

**Agent 性能测试**
评估 Agent 在多步骤任务中表现的方法。关注指标：任务完成率、步骤数、Token 消耗、工具调用成功率、错误恢复能力等。

**端到端评估（End-to-End Eval）**
以最终业务指标衡量整个系统表现的评估方式。不关注中间步骤是否正确，只看最终输出是否满足用户需求。最接近真实使用场景的评估方法。

***

## 工程化

**API 设计**
定义 AI 服务的接口规范。包括端点设计、请求/响应格式、认证方式、速率限制、错误码等。==AI 应用的 API 设计需要特别考虑流式响应和异步调用。==

**FastAPI**
Python 的高性能 Web 框架，自动生成 OpenAPI 文档。内置异步支持、类型校验、依赖注入。是构建 AI 服务 API 的首选框架。

**Docker 容器化**
将应用及其依赖打包为标准化容器，确保在任何环境一致运行。AI 应用容器化的挑战：GPU 驱动兼容、模型文件体积大、内存需求高。

\==**流式输出（Streaming）**==
逐 Token 返回模型输出，而非等待完整响应。大幅改善用户感知延迟。==SSE（Server-Sent Events）是常用传输协议。==

**异步调用**
不阻塞主线程发起 LLM 请求，通过回调或协程处理结果。高并发场景下的必备模式。Python 的 `async/await` 是主要实现方式。

**负载均衡**
在多个模型实例间分摊请求。策略包括轮询、最少连接、基于延迟等。对 AI 服务尤为重要，因为单次推理耗时长、资源占用高。

**缓存策略**
缓存重复或相似请求的模型响应。包括精确匹配缓存和语义相似缓存（用 Embedding 判断）。可显著降低延迟和成本。

**监控与日志**
收集和分析 AI 服务的运行时数据。关键指标：请求延迟、Token 消耗、错误率、缓存命中率。日志应包含完整的输入输出对以支持调试和审计。

**系统设计**
从全局视角规划 AI 应用的架构。包括组件划分、数据流、扩展策略、容错机制等。面试高频考点，需要能画出架构图并解释各组件职责。

\==**CI/CD（持续集成/持续部署）**==
自动化构建、测试和部署流水线。AI 应用的 CI/CD 额外需要：Prompt 版本管理、Eval 自动运行、模型 A/B 测试、灰度发布。

\==**沙箱（Sandboxing）**==
隔离执行环境，防止 AI 生成的代码或操作影响宿主系统。方法包括 Docker 容器、WebAssembly、虚拟机等。Code Execution 的安全基础。

**权限管理**
控制 Agent 能访问哪些资源和执行哪些操作。遵循最小权限原则。包括工具级权限（能调用哪些工具）和数据级权限（能访问哪些数据）。

**错误处理**
处理 AI 应用中各类异常的策略。包括模型调用失败、工具超时、输出格式错误、内容安全违规等。需要优雅降级而非直接崩溃。

**多模型协作**
组合多个模型完成复杂任务。模式包括：路由（根据任务选模型）、级联（一个模型的输出作为另一个的输入）、投票（多模型结果取一致）。

**Prompt 管理**
版本化管理提示词资产的实践。包括 Prompt 模板存储、A/B 测试、版本回滚、效果追踪。生产环境中 Prompt 是核心资产，需要像代码一样管理。

***

## 行业标准

**LLMs.txt**
为 AI 爬虫定义站点访问规范的文件。类似 robots.txt，但专门针对大模型的数据抓取需求。网站可通过此文件声明哪些内容可供 AI 训练/检索使用。

**robots.txt 演进**
robots.txt 从搜索引擎爬虫规范演进到 AI 时代的访问控制。传统 robots.txt 无法满足 AI 特有的需求（如训练 vs 检索的区分），催生了 LLMs.txt 等新标准。

**Agentic RL**
让 Agent 在与真实环境的交互中通过强化学习持续优化行为。区别于传统 RLHF 的离线训练，Agentic RL 在线学习，Agent 能从实际任务执行中积累经验。

\==**超级个体**==
借助 AI 工具将个人能力大幅扩展的理念。一个人借助 Agent 完成原本需要团队才能完成的工作。是 AI 时代的工作方式愿景。

**AI 应用工程师**
将 AI 模型能力转化为可落地产品的工程师角色。核心能力：应用架构设计、Prompt Engineering、RAG 系统搭建、API 开发。不要求训练模型，但要求会用模型。

**Agent 开发工程师**
专注构建自主 Agent 系统的工程师角色。核心能力：Agent 架构设计、工具集成、编排逻辑、状态管理、评估优化。比 AI 应用工程师更侧重 Agent 范式。

**LLM Engineer**
深耕大模型本身的工程师角色。涉及模型训练、微调、推理优化、部署。需要深厚的机器学习背景。与 AI 应用工程师形成"造模型"vs"用模型"的分工。

**MLOps**
机器学习运维的实践体系。将模型生命周期（训练、评估、部署、监控、迭代）纳入工程化管理。是 DevOps 在 AI 领域的延伸。

**推理工程师**
专注优化模型推理性能的工程师。工作包括：模型压缩（量化/蒸馏）、推理引擎优化（TensorRT/vLLM）、服务架构设计。目标：更低延迟、更低成本、更高吞吐。

\==**AI 产品化**==
将 AI 技术能力转化为可商用产品的全过程。包括：需求定义、技术选型、体验设计、合规审查、运营迭代。技术只是手段，产品化决定商业价值。

***

## 额外关键词

**知识库（Knowledge Base）**
为 RAG 系统提供外部知识的结构化数据集合。可以是文档、数据库、API 响应等。知识库的质量直接决定 RAG 系统的输出质量。

**GUI Agent**
能直接操控图形用户界面的 Agent。通过截图理解界面、模拟点击和输入完成操作。应用场景：自动化测试、RPA、辅助操作。挑战在于界面多样性和动态变化。

\==**低代码平台**==
通过可视化拖拽方式构建 AI 应用的平台。降低了 AI 应用开发门槛，非工程师也能快速搭建。典型产品：Dify、Coze、Flowise。适合简单场景，复杂需求仍需代码开发。

**NotebookLM**
Google 推出的 AI 知识助手产品。用户上传文档后，AI 基于这些文档回答问题、生成摘要。展示了"个人知识库 + AI"产品形态的潜力。

**Anthropic Claude**
Anthropic 公司开发的大语言模型系列。以安全性和长上下文处理著称（200K Context Window）。在 Agent 开发、代码生成、内容分析等场景表现优秀。Claude Code 是其 CLI 工具。

***

### 组成段落

在大模型技术飞速演进的今天，理解从底层到应用的完整知识体系至关重要。**Transformer** 架构通过**自注意力机制**对序列中的每个 **Token** 建立全局关联，**Context Window** 决定了模型一次能"看到"多少信息；**Temperature** 与 **Top-P** 控制输出的随机性，**Embedding** 将语义压缩为向量空间中的坐标，而 **Fine-tuning**——尤其是 **SFT（监督微调）**——让通用模型适配特定场景；**RLHF** 通过人类反馈对齐价值观，**GRPO** 则进一步优化策略梯度，配合**推理优化**与\*\*量化（Quantization）\*\*将模型压缩至可部署规模；即便如此，**幻觉（Hallucination）** 依然是悬而未决的挑战，**Few-shot / Zero-shot** 提示策略则在无需重训的前提下激发模型的泛化能力。

构建智能体时，**ReAct 范式** 将推理与行动交织执行，**Plan-and-Solve 范式** 先拆解目标再逐步求解，**Reflection 范式** 让 Agent 回顾自身输出并自我修正；**Tool Use（工具调用）** 和 **Function Calling** 赋予 Agent 操控外部世界的手臂，整个 **Agent Loop** 在**规划器（Planner）** 的驱动下持续运转，遵循**观察循环（Observe-Orient-Decide-Act）** 的节奏感知环境、作出**自主决策**；**Harness Engineering** 负责搭建稳健的测试脚手架，**Multi-Agent** 系统将任务分发给若干**子代理（Sub-agent）**，依托**编排（Orchestration）** 协调彼此，**Agent 通信** 协议保证消息可靠传递；**状态管理** 维护跨步骤的上下文一致性，**失败恢复** 机制在工具报错时优雅降级，**Guardrails** 划定安全边界，整套 **Agentic Workflow** 最终落地为**Vibe Coding** 式的流畅开发体验，推动 **AI 驱动开发** 成为新的工程范式。

上下文的质量决定输出的上限，**Context Engineering** 是比 **Prompt Engineering** 更系统的工程学科；**RAG（检索增强生成）** 将外部**知识库**实时注入模型，依赖**向量数据库** 存储语义索引，**Contextual Retrieval** 在检索时附带段落背景以提升相关性，**GSSC 管线（Gather / Select / Structure / Compress）** 系统化地收集、筛选、组织并压缩信息；**记忆系统** 跨会话沉淀用户偏好，**Chunking** 策略影响文档切分粒度，**BM25** 作为稀疏检索的经典基线与向量检索互补，**Think Tool** 让模型在行动前显式地"思考一步"，**Context Window 管理** 避免超长输入截断关键信息，而降低**检索失败率** 则是保证端到端质量的核心指标。

协议层面，**MCP（Model Context Protocol）** 统一了工具接入标准，**MCP Server** 暴露能力、**MCP Client** 发起调用，**工具发现** 机制让 Agent 动态感知可用工具；**A2A（Agent-to-Agent）** 和 **ACP（Agent Communication Protocol）** 定义了智能体间的协作语言，**Code Execution** 沙箱让模型安全运行代码，**Desktop Extensions** 与 **.mcpb 扩展包** 将能力打包分发；**LangChain** 提供链式调用抽象，**LangGraph** 引入有向图编排复杂流程，**Dify** 和 **Coze** 则以低代码平台的形态让非工程师也能搭建 Agent 应用；结合 **GUI Agent**，模型甚至能直接操控图形界面完成任务，而 **NotebookLM** 展示了知识型 AI 产品的另一种形态。

评估体系同样不可或缺：**Eval（评估）** 是迭代优化的指南针，**SWE-Bench** 考验代码修复能力，**BrowseComp** 衡量网页浏览与信息提取水平；**基准噪声** 与**评估污染** 提醒我们榜单数字并不总是可信，**AI 抗性评估** 专门测试模型在对抗性输入下的鲁棒性，**黄金数据集** 和 **Human Eval** 提供人工标注的权威参照，**Agent 性能测试** 关注多步任务的成功率，**端到端评估** 则以真实业务指标检验整套系统的交付价值。

工程化落地需要一整套基础设施：**API 设计** 决定服务边界，**FastAPI** 快速构建高性能接口，**Docker 容器化** 保证环境一致性；**流式输出（Streaming）** 大幅改善用户感知延迟，**异步调用** 提升并发吞吐，**负载均衡** 在多实例间分摊请求，**缓存策略** 复用高频推理结果，**监控与日志** 让线上异常无所遁形；**系统设计** 阶段就需考虑**沙箱（Sandboxing）** 隔离和**权限管理**，**错误处理** 保证链路韧性，**多模型协作** 将不同专长的模型组合为更强的整体，**Prompt 管理** 平台则版本化维护提示词资产；**CI/CD** 流水线将上述一切持续集成交付，**MLOps** 将模型生命周期纳入工程化管理，**推理工程师** 专注于降低延迟与成本，为 **AI 产品化** 扫清最后一公里的障碍。

在行业标准演进上，**LLMs.txt** 为 AI 爬虫定义了站点级的访问规范，是 **robots.txt 演进** 在大模型时代的延伸；**Agentic RL** 让智能体在与环境的真实交互中强化学习，催生出能独当一面的**超级个体**；**AI 应用工程师** 负责将模型能力转化为产品价值，**Agent 开发工程师** 专注构建自主任务系统，**LLM Engineer** 深耕模型训练与微调；以 **Anthropic Claude** 为代表的前沿模型正在重新定义智能的边界——而掌握以上每一个词汇，正是在这场变革中站稳脚跟的起点。

***

## 参考引用

* \[\[快速入行SOP-AI应用开发行动清单]] — 对应的关键词清单原文
* \[\[AI领域全景地图-Agent应用开发求职视角]] — AI 全景分层 + 技能树
* \[\[../../02\_AREAS/AI/wiki/concepts/Agent架构与编排]] — Agent 设计模式 + MCP 协议
* \[\[../../02\_AREAS/AI/wiki/concepts/上下文工程]] — GSSC 管线 + Contextual Retrieval
* \[\[../../02\_AREAS/AI/wiki/concepts/Agent基础与训练]] — LLM 基础 + 三种范式
* \[\[../../02\_AREAS/AI/wiki/concepts/评估与基准]] — Eval 方法论 + SWE-Bench
