本章目标:搞清楚几个绕不开的基础概念,了解当前主流 AI 工具的定位与差异,理解我们为什么选择 Dify 来落地实战。
一、你必须知道的几个概念
在接触任何工具之前,先把这几个词搞清楚。它们会反复出现,也是面试时被问到 AI 相关问题的基础词汇。
大模型(LLM)
LLM = Large Language Model,大语言模型。
可以理解为一个经过海量文本训练的超级大脑。它的核心能力是:理解自然语言输入,生成自然语言输出。GPT-4、Claude、DeepSeek、Gemini 都是大模型。
大模型本身只是一个"能力核心",它不会主动干任何事——你输入什么,它才处理什么。所以大模型 ≠ AI 产品,AI 产品是在大模型外面包了一层业务逻辑。
记住三个面试常考的「它不会」:
- 它不联网、不实时:知识停在训练截止那一刻,问它今天的新闻只会编(这正是 RAG 要解决的)。
- 它不记忆:一次请求就是一次性的,上一轮说过什么,全靠你这轮再喂给它(这正是「上下文」「记忆」要解决的)。
- 它不执行:它只会「输出文字」,真要查数据库、跑代码,得你给它工具(这正是 Function Calling / Agent 要解决的)。
Token
Token 是大模型处理文本的基本单位。中文大约 1 个字 = 1-2 个 token,英文大约 1 个词 = 1 token。
为什么要了解 Token?
- 大模型的使用成本按 token 计费
- 模型有"上下文窗口"限制,超过就会遗忘前面的内容
- 企业里讨论"额度",本质上就是在讨论 token 预算
Prompt(提示词)
Prompt 是你给大模型的输入指令。大模型的输出质量,70% 取决于 Prompt 的质量。
系统 Prompt(System Prompt):在对话开始前预设的角色和规则,是 AI 产品区分普通聊天和专业应用的关键。比如"你是一个专业的招聘助手,只回答和招聘相关的问题"就是一段系统 Prompt。
写好 Prompt 是一项真正的技能,也是目前企业里最容易上手、最有价值的 AI 能力之一。
RAG(检索增强生成)
RAG = Retrieval-Augmented Generation。
大模型的知识是训练时固化的,不知道你公司的内部文件、最新政策、产品手册。RAG 解决的就是这个问题:先从你的知识库里检索出相关内容,再把它塞给大模型,让它基于这些内容来回答。
用户提问
↓
在知识库中检索相关片段
↓
将检索结果 + 原始问题一起发给大模型
↓
大模型基于真实资料生成回答
企业内部的 AI 客服、政策问答、产品导购,背后几乎都是 RAG。
Agent(智能体)
Agent 是能自主规划和执行多步任务的 AI 系统。
一句话:**Agent = LLM(大脑) + 工具(手脚) + 循环(自治) + 记忆(状态)**。面试官问「Agent 比直接调 LLM 多了什么」,答的就是这后三样。
普通对话:你问一句,AI 答一句。 Agent:你给一个目标,AI 自己拆解步骤、调用工具、执行、验证结果。
比如"帮我搜索竞品信息,整理成表格,发到邮件"——这是一个三步任务,Agent 会自己串起来完成,而不需要你手动拆解每一步。
工作流(Workflow)
工作流是把多个 AI 步骤串联成固定流程的方式。
与 Agent 的区别:工作流是你预先设计好的路径,AI 按图索骥执行;Agent 是 AI 自己做规划和决策。工作流更可控、更稳定,适合标准化的重复任务;Agent 更灵活,适合处理复杂的、不可预测的任务。
目前企业落地最多的是工作流,Agent 还在快速发展中。
上下文窗口:模型一次能看多少
「上下文窗口」= 模型单次请求能容纳的 token 总量(输入 + 已生成)。它是个硬上限:
- 塞太多 → 注意力被稀释,关键信息被淹没,效果反而下降(不是越长越好)。
- 快满了 → 要么报错,要么硬截断丢信息 → 长任务必须做截断 / 摘要 / 外部记忆(后面手搓 Agent 会踩到)。
二、工具生态全景
从"有多少代码"的角度,AI 应用开发工具可以分为三层:
纯自研(代码)
LangGraph / LangChain / 直接调 API
↑ 灵活性高,门槛高
低代码平台
Dify / Coze / Aily / Workbuddy
↑ 可视化搭建,门槛低
纯产品(直接用)
ChatGPT / Claude / 豆包
↑ 零门槛,但无法定制
各工具定位对比
| 工具 | 定位 | 核心优势 | 核心局限 |
|---|---|---|---|
| Coze(扣子) | 字节跳动出品,面向大众的 AI 应用搭建平台 | 上手极快,生态丰富,与抖音/飞书打通 | 产出物依赖字节生态,独立性弱;简历里不好体现"独立搭建能力" |
| Aily | 飞书内置 AI 助手 | 与飞书文档、多维表格深度集成,企业协作场景强 | 无法脱离飞书环境独立部署,演示受限 |
| Workbuddy | 面向职场的 AI 效率工具 | 场景垂直,上手快 | 定制空间有限,更适合个人效率提升,而非企业级开发 |
| Dify | 开源 AI 应用开发平台 | 可独立部署、RAG 流程可视化、行业认可度高、支持多模型切换 | 学习曲线相对陡峭,需要一定的搭建和调试能力 |
| LangGraph / LangChain | Python 框架,纯代码开发 | 灵活度最高,可实现任意复杂逻辑 | 需要编程基础,门槛高,不适合非技术岗 |
| 纯 API 自研 | 直接调用大模型 API,自己写业务逻辑 | 完全自主可控,性能最优 | 需要完整的工程团队,成本高 |
三、为什么我们选 Dify?
这不是说 Dify 是最好的工具,而是对于这门课的目标来说,Dify 是最合适的选择。
原因一:你能独立拥有它
Dify 是开源项目,可以本地部署,也可以用它的云服务。重要的是,你搭建的东西完全属于你——可以独立演示、可以截图放进简历、可以部署给真实用户用。
Coze 搭的东西,本质上是字节平台上的一个配置;Dify 搭的东西,你可以说"我独立搭建并部署了一个 AI 应用"。
原因二:RAG 流程完全可视化
Dify 的知识库和工作流是可视化的——你能看到文档如何被切片、检索时命中了哪些片段、最终 Prompt 是什么构成的。
这不只是方便调试,更重要的是:你能真正理解 RAG 在做什么,而不是用一个黑盒。这种理解在面试中非常有价值。
原因三:行业认可度高
在 AI 应用开发领域,Dify 是目前国内外使用最广泛的开源平台之一,GitHub star 数超过 8 万。技术团队、产品团队都在用,不是小众工具。
原因四:技术迁移性强
学会了 Dify 的核心逻辑(Prompt 管理、知识库、工作流、API 集成),切换到 Coze、自研平台的学习成本很低。底层逻辑是一样的,只是界面不同。
四、什么情况下用其他工具?
Dify 不是万能的,了解边界同样重要:
- 想快速做一个抖音/飞书生态的 AI 应用 → Coze,与字节生态打通更顺滑
- 团队重度使用飞书,做内部 AI 助手 → Aily,集成成本最低
- 有技术团队,需要高度定制化的复杂 Agent → LangGraph + 自研
- 产品经理/运营想验证一个 AI 场景的可行性 → Dify 最合适,快速搭,快速验证
本章小结:大模型是大脑,RAG 是记忆,Agent 是手脚,工作流是规范动作。Dify 让你在不写代码的情况下,把这些能力组装成一个真实可用的 AI 产品——这正是我们这门课要做的事。
下一步:概念讲完了,接下来我们就用 Dify 做一个真实项目——一个生鲜电商的 AI 导购机器人。下一章从一个真实翻车案例开始,你会亲眼看到"不接 RAG 会有多离谱",然后亲手把它修好。