🧱 Stage 01

工具入门与
环境搭建

在深入学习提示词和算法之前,先把工具用起来。这个阶段的目标是:理解 API Key 与 Token 机制,在本地成功运行 Dify,并熟练使用日常 AI 辅助工具。


Core Concept
🔑 API Key 与 Token

与大模型交互最基础的两个概念,必须清楚理解才能避免安全风险和不必要的费用。

🔑
API Key 是什么
API Key 是你访问大模型服务的身份凭证,类似银行卡密码。通过 HTTP 请求头 Authorization: Bearer sk-xxxx 传递给服务端。

安全原则: Key 不要出现在前端代码、不要 commit 到 Git、建议通过环境变量注入。
Bearer Token 环境变量 .env 文件
🪙
Token 计费机制
Token 是什么
模型的最小处理单位,约 1 个英文单词 = 1 token,1 个汉字 ≈ 1.5 token
Context Window
单次请求可处理的最大 token 数。超出会截断,需要注意长文档处理
Prompt Token
你发送给模型的内容(System Prompt + 对话历史 + 用户问题)
Completion Token
模型生成的回复内容,计费通常高于 Prompt Token

Local Deployment
🐳 Docker 私有部署 Dify

在本地运行 Dify,数据完全自主可控,是贯穿后续所有阶段学习的核心实践平台。

部署步骤
Step 01
安装 Docker Desktop
从 Docker 官网下载安装,Windows 需要开启 WSL2 后端。安装后验证 docker --version 正常输出即可。
Step 02
克隆 Dify 仓库
git clone https://github.com/langgenius/dify.git
Step 03
配置环境变量
复制 docker/.env.example.env,根据需要修改密钥等配置。
Step 04
启动服务
进入 docker 目录执行:
docker compose up -d
Step 05
访问与初始化
浏览器访问 http://localhost/install,完成管理员账号注册。
学习资源
🪟 Windows 注意事项: localhost 在 Windows 某些情况下可能解析到 IPv6 地址导致连接失败,如果无法访问 Dify, 尝试改用 127.0.0.1 直接访问。
Dify 核心功能模块
🗂️
知识库
上传 PDF/Word/网页等文档,自动向量化存储,构建私有知识问答系统的核心基础。第三阶段深入学习。
⚙️
工作流
可视化的 AI 流程编排,支持条件分支、循环、HTTP 调用、代码节点等,无需编码即可构建复杂 AI 应用。
💬
Chatbot
基于 System Prompt 和知识库快速搭建对话机器人,支持多轮对话记忆,可一键发布为 API 或嵌入网页。
🤖
Agent
让模型具备工具调用能力,可连接搜索、代码执行、知识库等工具,自主完成多步骤任务。第四阶段深入学习。
🔌
插件市场
丰富的工具插件生态,包括搜索、天气、数据库查询等,也支持自定义开发 Dify 插件。v1.15.0 新增 MCP 双向支持,插件可发布为 MCP 服务。
📊
日志与分析
查看完整的请求日志、Token 消耗统计,是优化提示词和调试 AI 应用的重要工具。v1.15.0 新增 Human-in-the-Loop 人机协作、Agent Runtime 2.0。

Daily Tools
🛠️ AI 辅助工具使用

不同工具有各自最适合的使用场景,根据任务选择合适的工具才能事半功倍。

🍒 Cherry Studio — 日常对话与多模型对比

最适合的场景:日常 AI 对话、提示词调试与迭代、同一问题对比多个模型的输出差异。


核心技巧:

  • 在设置中配置多个模型服务商(千问、DeepSeek、GLM),方便随时切换
  • 使用"系统提示词"功能为常用助手设置固定角色
  • 利用"对话分组"管理不同项目的对话记录
  • 通过"导出对话"功能保存和整理优质提示词案例

官网 ↗
Trae — 字节跳动 AI 原生 IDE,600万+用户

最适合的场景:代码补全、函数生成、代码解释、重构建议、单元测试生成。2026年已进入 Agent 编程时代。


核心模式:

  • IDE 模式:传统代码补全,类似 Copilot 体验
  • Work 模式(原 SOLO):AI 自主拆解任务、跨文件修改、自动执行
  • Builder 模式:口语化描述需求,AI 生成完整项目
  • 基础版免费,中文需求理解准确率行业领先,代码生成准确率 98%
🤖 Qoder — 阿里 Agent IDE,深度绑定阿里云生态

最适合的场景:需要多步骤自动执行的复杂任务,如"分析代码仓库并生成文档"、"修改多个文件实现某个功能"等。深度集成阿里云百炼模型服务。


核心特性:

  • Agent 模式自动拆解任务、调用工具、执行代码
  • Skills 技能系统:可自定义和复用 AI 工作流
  • 原生 MCP 支持,可接入丰富工具生态
  • 企业版支持私有化部署,安全合规
⌨️ Claude Code — Anthropic 命令行 AI 工具

最适合的场景:全键盘流程序员的神器。驻留在终端中,长上下文理解能力极强,适合大型代码库理解、重构和复杂任务。


核心特性:

  • 纯 CLI 工具,无需 GUI,直接在 Terminal 中使用
  • 超长上下文窗口,理解整个代码仓库
  • 原生 MCP 支持,可接入丰富工具生态
  • 适合自动化脚本、CI/CD 集成
🤝 CodeBuddy — 腾讯 AI 编程助手

最适合的场景:企业级开发场景,与腾讯云生态深度集成。支持 IDE 插件和 CLI 两种形态。


核心特性:

  • 支持 VS Code、JetBrains 等主流 IDE 插件
  • 企业版支持私有化部署,安全合规
  • 与 Lighthouse 集成,从设计到部署全流程 AI 辅助
🌟 通义千问 — 中文理解与综合任务

最适合的场景:中文内容创作、文档总结、代码生成、知识问答。API 价格亲民,适合作为主力模型。


千问模型系列:

qwen-max / qwen3.6-max
旗舰模型,综合能力最强,适合复杂任务
qwen-plus / qwen3.6-plus
性价比高,日常使用推荐首选
qwen-turbo / qwen3.6-turbo
响应最快,适合对速度要求高的场景
qwen-long
超长上下文,处理长文档专用
🏆 WorkBuddy — 腾讯桌面级 AI 办公工作台,国内第一

最适合的场景:泛职场人群、运营、行政、OPC(一人公司)。重度依赖腾讯生态、需要跨设备协同的用户。


核心特性:

  • 流量入口型,依托微信/企微生态,支持手机远程派活
  • 多模态交互体验极佳,技能生态丰富
  • 2026年6月PC端月访问量达 2097万次,占整个大盘三分之一
  • 超第二、三名总和,国内绝对领先
⚙️ QoderWork — 阿里企业基建型办公工具

最适合的场景:程序员、数据分析师、产品经理。需要处理复杂数据、深度分析研报、搭建本地自动化工作流的用户。


核心特性:

  • 主打本地化运行与数据安全,支持 MCP 协议和自定义技能
  • 技术扩展性极强,适合复杂数据处理场景
  • 2026年6月PC端月访问量达 788万次,阿里系合计约919万次
🤖 DuMate 搭子 — 百度多智能体协作办公

最适合的场景:日常办公、资料检索与处理。依托百度文心大模型底座,在知识密集型场景发力。


核心特性:

  • 桌面级多智能体协作,主打多智能体分工协作
  • 支持语音多模态输入
  • 处于第二梯队分化阶段,知识密集型场景表现突出

Resources
📚 推荐学习资源