>_ AI 应用训练营
lang ~ ai-course/02-core-concepts-and-tools 9 min read

02 · AI 核心概念与工具生态

LLM、Token、RAG、Agent 这些绕不开的词,以及为什么选 Dify

本章目标:搞清楚几个绕不开的基础概念,了解当前主流 AI 工具的定位与差异,理解我们为什么选择 Dify 来落地实战。


一、你必须知道的几个概念

在接触任何工具之前,先把这几个词搞清楚。它们会反复出现,也是面试时被问到 AI 相关问题的基础词汇。

大模型(LLM)

LLM = Large Language Model,大语言模型。

可以理解为一个经过海量文本训练的超级大脑。它的核心能力是:理解自然语言输入,生成自然语言输出。GPT-4、Claude、DeepSeek、Gemini 都是大模型。

大模型本身只是一个"能力核心",它不会主动干任何事——你输入什么,它才处理什么。所以大模型 ≠ AI 产品,AI 产品是在大模型外面包了一层业务逻辑。

记住三个面试常考的「它不会」:

  • 它不联网、不实时:知识停在训练截止那一刻,问它今天的新闻只会编(这正是 RAG 要解决的)。
  • 它不记忆:一次请求就是一次性的,上一轮说过什么,全靠你这轮再喂给它(这正是「上下文」「记忆」要解决的)。
  • 它不执行:它只会「输出文字」,真要查数据库、跑代码,得你给它工具(这正是 Function Calling / Agent 要解决的)。

Token

Token 是大模型处理文本的基本单位。中文大约 1 个字 = 1-2 个 token,英文大约 1 个词 = 1 token。

为什么要了解 Token?

  • 大模型的使用成本按 token 计费
  • 模型有"上下文窗口"限制,超过就会遗忘前面的内容
  • 企业里讨论"额度",本质上就是在讨论 token 预算

Prompt(提示词)

Prompt 是你给大模型的输入指令。大模型的输出质量,70% 取决于 Prompt 的质量。

系统 Prompt(System Prompt):在对话开始前预设的角色和规则,是 AI 产品区分普通聊天和专业应用的关键。比如"你是一个专业的招聘助手,只回答和招聘相关的问题"就是一段系统 Prompt。

写好 Prompt 是一项真正的技能,也是目前企业里最容易上手、最有价值的 AI 能力之一。

RAG(检索增强生成)

RAG = Retrieval-Augmented Generation。

大模型的知识是训练时固化的,不知道你公司的内部文件、最新政策、产品手册。RAG 解决的就是这个问题:先从你的知识库里检索出相关内容,再把它塞给大模型,让它基于这些内容来回答。

用户提问
   ↓
在知识库中检索相关片段
   ↓
将检索结果 + 原始问题一起发给大模型
   ↓
大模型基于真实资料生成回答

企业内部的 AI 客服、政策问答、产品导购,背后几乎都是 RAG。

Agent(智能体)

Agent 是能自主规划和执行多步任务的 AI 系统。

一句话:**Agent = LLM(大脑) + 工具(手脚) + 循环(自治) + 记忆(状态)**。面试官问「Agent 比直接调 LLM 多了什么」,答的就是这后三样。

普通对话:你问一句,AI 答一句。 Agent:你给一个目标,AI 自己拆解步骤、调用工具、执行、验证结果。

比如"帮我搜索竞品信息,整理成表格,发到邮件"——这是一个三步任务,Agent 会自己串起来完成,而不需要你手动拆解每一步。

工作流(Workflow)

工作流是把多个 AI 步骤串联成固定流程的方式。

与 Agent 的区别:工作流是你预先设计好的路径,AI 按图索骥执行;Agent 是 AI 自己做规划和决策。工作流更可控、更稳定,适合标准化的重复任务;Agent 更灵活,适合处理复杂的、不可预测的任务。

目前企业落地最多的是工作流,Agent 还在快速发展中。

上下文窗口:模型一次能看多少

「上下文窗口」= 模型单次请求能容纳的 token 总量(输入 + 已生成)。它是个硬上限:

  • 塞太多 → 注意力被稀释,关键信息被淹没,效果反而下降(不是越长越好)。
  • 快满了 → 要么报错,要么硬截断丢信息 → 长任务必须做截断 / 摘要 / 外部记忆(后面手搓 Agent 会踩到)。

二、工具生态全景

从"有多少代码"的角度,AI 应用开发工具可以分为三层:

纯自研(代码)
  LangGraph / LangChain / 直接调 API
        ↑ 灵活性高,门槛高

低代码平台
  Dify / Coze / Aily / Workbuddy
        ↑ 可视化搭建,门槛低

纯产品(直接用)
  ChatGPT / Claude / 豆包
        ↑ 零门槛,但无法定制

各工具定位对比

工具 定位 核心优势 核心局限
Coze(扣子) 字节跳动出品,面向大众的 AI 应用搭建平台 上手极快,生态丰富,与抖音/飞书打通 产出物依赖字节生态,独立性弱;简历里不好体现"独立搭建能力"
Aily 飞书内置 AI 助手 与飞书文档、多维表格深度集成,企业协作场景强 无法脱离飞书环境独立部署,演示受限
Workbuddy 面向职场的 AI 效率工具 场景垂直,上手快 定制空间有限,更适合个人效率提升,而非企业级开发
Dify 开源 AI 应用开发平台 可独立部署、RAG 流程可视化、行业认可度高、支持多模型切换 学习曲线相对陡峭,需要一定的搭建和调试能力
LangGraph / LangChain Python 框架,纯代码开发 灵活度最高,可实现任意复杂逻辑 需要编程基础,门槛高,不适合非技术岗
纯 API 自研 直接调用大模型 API,自己写业务逻辑 完全自主可控,性能最优 需要完整的工程团队,成本高

三、为什么我们选 Dify?

这不是说 Dify 是最好的工具,而是对于这门课的目标来说,Dify 是最合适的选择

原因一:你能独立拥有它

Dify 是开源项目,可以本地部署,也可以用它的云服务。重要的是,你搭建的东西完全属于你——可以独立演示、可以截图放进简历、可以部署给真实用户用。

Coze 搭的东西,本质上是字节平台上的一个配置;Dify 搭的东西,你可以说"我独立搭建并部署了一个 AI 应用"。

原因二:RAG 流程完全可视化

Dify 的知识库和工作流是可视化的——你能看到文档如何被切片、检索时命中了哪些片段、最终 Prompt 是什么构成的。

这不只是方便调试,更重要的是:你能真正理解 RAG 在做什么,而不是用一个黑盒。这种理解在面试中非常有价值。

原因三:行业认可度高

在 AI 应用开发领域,Dify 是目前国内外使用最广泛的开源平台之一,GitHub star 数超过 8 万。技术团队、产品团队都在用,不是小众工具。

原因四:技术迁移性强

学会了 Dify 的核心逻辑(Prompt 管理、知识库、工作流、API 集成),切换到 Coze、自研平台的学习成本很低。底层逻辑是一样的,只是界面不同。


四、什么情况下用其他工具?

Dify 不是万能的,了解边界同样重要:

  • 想快速做一个抖音/飞书生态的 AI 应用 → Coze,与字节生态打通更顺滑
  • 团队重度使用飞书,做内部 AI 助手 → Aily,集成成本最低
  • 有技术团队,需要高度定制化的复杂 Agent → LangGraph + 自研
  • 产品经理/运营想验证一个 AI 场景的可行性 → Dify 最合适,快速搭,快速验证

本章小结:大模型是大脑,RAG 是记忆,Agent 是手脚,工作流是规范动作。Dify 让你在不写代码的情况下,把这些能力组装成一个真实可用的 AI 产品——这正是我们这门课要做的事。

下一步:概念讲完了,接下来我们就用 Dify 做一个真实项目——一个生鲜电商的 AI 导购机器人。下一章从一个真实翻车案例开始,你会亲眼看到"不接 RAG 会有多离谱",然后亲手把它修好。