← 返回文档
项目文档 ·

第一章:AI 时代“新”名词

理解 LLM、API Key、Token、Agent 与 Skills 五个核心概念。

1.1 什么是 LLM(大语言模型)

一句话解释

LLM (Large Language Model)就像是一个读完了全人类海量文章的‘超级复读机’。它并不真正懂得这些话的意思,只是基于前面给定的文字,预测下一个最可能的词(token)。

大模型是怎么训练的

大语言模型的核心训练任务可以概括为:

根据前面的内容,预测下一个最可能出现的 Token。

听起来很简单,但只要训练数据足够多、模型参数足够大,这个任务就能让模型逐渐学会语言、知识、代码结构和常见的推理模式。

如果你感兴趣的话可以去读《Attention is all you need》以深入的了解 Transformer,这当然** **不在我们第0节AI课的分享范围内。

为了让大家更好的了解 LLM 是怎么工作的,接下来会简单讲解一下模型是如何训练的(为了尽可能简化,大部分细节被忽略了,甚至不一定对🤡但你理解了就好


  • 第一步:收集、清洗与整理数据

    训练大模型之前,需要收集和整理大量数据,例如:网页、书籍、新闻、百科、论文……

    收集到的原始数据不能直接全部用于训练,还需要进行清洗。

    常见处理包括但不限于:过滤低质量内容、去除部分隐私信息

    高质量的数据对于模型的训练极为重要(对人来说也很重要啊)

    如果训练数据中充满错误、重复或低质量内容,模型也更容易学到错误模式。


  • 第二步:把文字切成 Token

    大模型不能直接处理人类看到的文字,需要先把文字转换成数字。

    这个过程叫作 Tokenization,可以理解为将文本拆分成模型能够处理的标记。

    例如:我喜欢人工智能

    可能被拆成:我 | 喜欢 | 人工 | 智能

    也可能被拆成:我 | 喜 | 欢 | 人工智能

    具体如何拆分,取决于模型使用的 Tokenizer。

    每个 Token 都会对应一个编号,例如:

    我       → 1042
    喜欢     → 5738
    人工智能 → 18924

    模型实际接收到的不是文字,而是一串数字:[1042, 5738, 18924]

    所以大模型的上下文长度和 API 使用费用通常按照 Token 计算,而不是简单按照字数计算。


  • 第三步:把文本变成“预测题”

    例如,原始句子是:我喜欢吃苹果

    系统可以把它转换成类似下面的训练任务:

    看到“我”       → 预测“喜欢”
    看到“我喜欢”   → 预测“吃”
    看到“我喜欢吃” → 预测“苹果”

    一段普通文字,可以被拆成许多道“预测下一个 Token”的题目。

    再例如,训练数据中有一句话:天空是蓝色的

    模型看到:天空是,然后为下一个 Token 计算概率,例如:

    蓝色:65%
    晴朗:12%
    灰色:8%
    美丽:5%
    其他:10%

    正确答案是“蓝色”,如果模型给“蓝色”的概率很高,说明预测得比较好;如果模型认为“香蕉”最可能出现,说明预测得很差。


  • 第四步:计算模型错了多少

    训练系统会比较模型的预测与正确答案之间的差距。

    这个差距通常称为:

    损失值(Loss)

    可以简单理解为:

    预测越准确 → Loss 越小
    预测越离谱 → Loss 越大

    Loss 是训练程序用来判断模型当前表现的重要指标。


  • 第五步:根据错误调整模型参数

    模型内部包含大量参数。

    这些参数不是一条条人工编写的规则,而是大量数字。它们共同影响模型看到某些内容时,接下来更倾向于输出什么。

    模型预测完成后,训练程序会根据 Loss 调整参数,使模型下一次更容易预测出正确答案。

    初学阶段不需要理解其中的数学细节,只需要知道:

    模型每预测错一次,训练程序就会稍微调整模型内部的数字,使下一次预测更接近正确答案。

    整个过程可以简化为:

    输入文本
    
    预测下一个 Token
    
    与正确答案比较
    
    计算 Loss
    
    调整模型参数
    
    继续训练

  • 第六步:在海量数据上反复训练

    模型会在大量文本中不断进行下一个 Token 预测。例如:

    中国的首都是 → 北京
    1 + 1 = → 2
    春眠不觉晓 → 处处闻啼鸟
    function add(a, b) { → return a + b;

    经过海量训练后,模型会逐渐学到:

    • 词语之间的关系

    • 句子的常见结构

    • 不同概念之间的关联

模型选择

单模态:过去的 AI 只能处理单一的“文本”输入和输出(纯聊天、写代码)。

多模态(Multimodal):“模态”指信息的表达形式(如文字、图片、音频、视频)。多模态 AI 意味着打通了视听感官,你可以发一张手写高数题的照片让它解析,或者直接用语音和它流畅对答

为什么一些纯文本模型(比如 DeepSeek v4 系列)也能接受图片、pdf等输入? 软件厂商在大模型前面套了一层ocr工具,将图片中的文字内容提取出来再传给大模型,对手写字迹和图片理解场景很不友好,当然在编程、数学推理、文字写作方面适用。

大模型的记忆是“假的”

前文我们说到 LLM 是一个猜词器,只是在预测"接下来最可能说什么"。那么我们在和 AI 聊天时,大模型是怎么做到**“记住”**对话中刚才说过的事,甚至是跨对话把你的喜好记下来,这不就是“记忆”吗?

其实,这是 AI 软件开发者为 LLM 设计的“伪记忆机制”。当前对话中,软件会把历史聊天记录拼在提示词里一同传入;而跨对话的“记忆”,则是软件将你的偏好提取成用户画像,存入外部数据库。

当你新开一个对话,问AI “我是谁,有什么喜好”,传入大模型的不只有你当下的问题,还包括一个由软件组装好的“完整上下文”。这里面通常包含三部分:

  1. 系统提示词(AI的人格):定义AI自身身份和行为规则,比如“你的名字是豆包,逻辑清晰,思维缜密...”。

  2. 用户画像(关于你的记忆):从你历史对话中提炼出的个人档案,比如“用户是一个大学生,家里有一只小猫...”。这些内容被保存在 AI 软件的云端服务器当中。

  3. 历史对话(当前的上下文):你们刚刚聊过的内容。当上下文过长时,软件会对其进行压缩或摘要处理,将有用的部分传入大模型进行下一轮的推理

这三部分会被拼接成一段长文本,一起喂给大模型做推理(也就是我们前文说到的“猜词”)。模型“看到”了这些信息,才能给出有针对性的回答。一旦这次推理结束,它又会回到“无状态”的初始状态。

豆包的系统提示词(来源:oiuv/system_prompt):

你的名字是豆包,逻辑清晰,思维缜密。
你能精准解读问题、分析问题,回答时尽可能丰富、详尽、深入,并在关键问题上做延展回答,给出一些例子说明。
你在写文案和主题创作时,会基于用户的创作要求提供文案参考,数量尽可能多,且类型丰富,并根据用户需求适当调整文案字数的长短。
回答时请始终保持逻辑严谨,表述专业,结构清晰,分段准确,并会正确使用 Markdown 格式。
今天的日期:2024 年 8 月 7 日 星期三

模型幻觉

大模型会尽可能的完成任务,有的时候让它了解到不会的东西可以直接说不会,可以降低 AI 幻觉出现的概率。并且尽可能给AI提供更多的背景信息,更多工具(包括但不限于联网搜索)

案例-洗车店离我只有50米,走路去还是开车去?

观看案例视频

思考一下-LLM知道自己是谁吗?


1.2 什么是 API Key

API Key(接口密钥)就像是你在数字世界里的“电子身份证”或“专属钥匙”。 当你想用代码或者第三方工具去调用某个 AI 服务(比如把Mimo、Deepseek接到Agent工具或者自己的网页里)时,这个服务商需要通过 API Key 来辨别:“你是谁”以及“你有没有权限/额度来用我的服务”

Base URL通常与API KEY一起出现,它解决的是请求发往哪里的问题。它其实就是一串网址。区分你调用的服务商是谁,靠的就是Base URL。

打个比方

在学校里,你要想使用校园网,通常需要两步:

  1. 连哪个网络? 学校有两个不同的 WiFi通道:Teacher_WiFiStudent_WiFi 。你作为的学生的身份需要选择Student_WiFi 。—— 这就是 Base URL,决定了你的请求发往哪个服务端。它是一个公开的通道,告诉你“从这里可以连进去”。

  2. 连上之后,手机会弹出一个登录页面,要求你输入学号和密码。—— 这就是 API Key(密钥)

学校的服务器看到你输入的学号和密码正确,就会做两件事:

  • 认证与授权:确认你是本校学生,一键放行,让你成功上网。

  • 计费与扣流量:开始统计你用了多少兆流量(在 AI 里就是消耗了多少 Token),并从你的校园卡账户里扣除相应的费用。

演示-获得一个你自己的 API key

DeepSeek 开放平台

注册DeepSeek开放平台账号并充值(可以充10元试试,不用来编程的话能用超级久),在 API Keys 页面右上角创建一个key,名称随便取一个,方便后续管理多个key(不同项目的Key分开可以方便查看每个项目的模型用量)。 另外一定不要将你的 API Key 直接写在程序当中发给别人,API Key 泄漏以后可以在开放平台面板上将其删除。下文为了方便演示直接写在了程序中,具体怎么保护你的 Key 你可以问问 AI。

管理API Key调用文档

前往 DeepSeek API 文档 查看 base_url 与可使用的模型名称,往下滑还能看到脚本样例。这里我使用 python 进行演示,代码我进行了简化的修改。如果你也想试试跟着运行一下代码,需要先保证你安装了 python 和 OpenAI SDK。

通过 Python 调用 API 并演示大模型并不知道自己是谁

在终端当中输入pip3 install openai 来安装OpenAI SDK。(无法正常下载的可以问问 AI 怎么解决,提示词中可以提到“镜像”这个关键词)

安装OpenAI SDK“我是谁?”

这边我演示了将豆包的系统提示词传给了 deepseek-v4-flash,它马上扮演起了豆包。

你可以动手试试大模型是否存在记忆

在 TRAE WORK 当中填写自定义模型

TRAE 模型提供商设置自定义模型设置

很多Agent软件中,有模型的预设,只需要填写API Key就可以添加使用了。如果预设当中没有你订阅或充值的模型厂商,可以选择自定义配置,填写在接口文档当中获取的Base URL、API Key 和 模型名称。

1.3 什么是 Token(词元)

一句话解释

Token 是 AI 处理文字的最小单位,就像乐高积木是搭建模型的最小零件;Token 也是一个计价单位,比如mimo-v2.5的每百万Tokens输出是2元。

关键知识点

  • Token 不等于字:中文里,一个汉字通常占 1-2 个 Token;英文里,一个单词可能占 1-3 个 Token

  • 为什么重要:API 调用按 Token 计费,理解 Token 能帮你省成本

  • 上下文窗口:每个模型有 Token 上限(如 8K、128K、1M),超出就会"忘记"前面的内容

  • 不同模型同一段话的Token数不一样:一个词组或字在训练语料当中出现次数越少,其占用的 Token 数可能越多。

演示

  1. 使用在线 Token 计数器(如 Tiktokenizer),输入不同长度的文本,观察 Token 数量变化

  2. 对比中英文同一内容的 Token 差异

你好,我是一个 AI 助手。今天我来帮你了解 Token 是什么。

Token 是大语言模型处理文本的基本单位。对于英文,一个 Token 大约是 4 个字符或 3/4 个单词。对于中文,一个汉字通常对应 1-2 个 Token。

Here's an example in English: "Hello, world!" might be tokenized as ["Hello", ",", " world", "!"].

费用计算公式: 总费用 = (输入Token × 输入单价) + (输出Token × 输出单价)

想一想

字更少,为什么反而更费 Token?【差评君】(哔哩哔哩)

为什么 MiniMax 大模型无法识别马嘉祺是谁?— mm叶文洁的回答(知乎)

为什么 AI 不能正正好输出800字的文章?


1.4 什么是 Agent(智能体)

一句话解释

Agent 是一个能自主思考、规划、使用工具来完成任务的 AI 系统

Agent = 大模型(大脑) + 记忆系统(记忆) + 工具(手脚) + 规划

生活类比

普通 AI 像一个只能回答问题的客服;Agent 像一个能帮你订机票、查天气、写报告、发邮件的私人助理。它能拆解任务、调用不同工具、自己检查结果。

或许你日常使用的都是一个基础的Agent

前文我们提到,LLM 的核心机制是根据上下文预测下一个 Token。它拥有强大的语言理解和生成能力,但本身不会主动获取外部信息,也不会主动执行任务。 那豆包、千问等 AI 助手是如何回答“最近天气怎么样”“六级考试报名时间是什么时候”这类需要实时信息的问题? 答案是:AI 可以调用搜索、数据库等外部工具获取信息,并将这些内容作为额外上下文提供给 LLM。基于更准确的信息,LLM 就能生成更加可靠的回答。 这就是 Agent 的基本思想:让大模型不仅会“回答”,还能够“行动”。

关键知识点

  • Agent vs LLM:LLM只能对话(预测下一个Token),Agent 能行动

  • 核心能力:感知(获取信息)→ 思考(分析决策)→ 行动(使用工具)→ 反馈(检查结果)

  • 生活中的 Agent:Siri、小爱同学是早期的智能助手;Codex、OpenClaw是更高级的 Agent

  • Agent 和工作流的区别:工作流:按照预先设计好的步骤执行任务; Agent:能够根据目标自主决定下一步行动,例如选择工具、查询知识库或调整执行策略。

  • 现在大家说的 Agent 一般是可以帮忙编写代码、处理电脑文件的软件


为什么不在网页上使用 AI ?

如果你想用AI来解决除了写作、聊天、查资料以外的“生产力”问题时,你会接触到 WorkBuddy、openclaw 这样的 Agent 软件,它们都需要被安装在一台电脑上。

很多时候,AI 只负责“告诉你怎么做”,真正动手的还是你。

比如你想让 AI 帮你整理一份课程资料。

普通 AI 的过程可能是:

  1. 你打开课程群,将所有的课程资料下载下来

  2. 把所有的文件拖到 AI 网页中

  3. AI 帮你整理

  4. 你再把结果复制出来

  5. 打开 Word 或 Notion

  6. 自己保存

这时候,你其实在充当 AI 和电脑之间的“搬运工”。

而 Agent 想做的是:

你只告诉它:“帮我把xxx这门课的课程资料整理好。资料全在飞书课程群当中”

然后它自己去调用飞书的能力,将文件下载到电脑本地、整理内容、创建文档并保存。

给我完整的代码

在之前很多人用AI来写代码的方式是:让AI写一段,复制出来粘到编辑器当中,检查有没有问题。

出了bug就将报错信息复制发给 AI ,然后AI再给你修改方式。对于很多人来说代码基础不行或者根本没有耐心看AI给的修改建议,就直接发给我完整的代码希望能够直接复制粘贴,放空大脑。

我们希望 AI 不只是待在聊天框里回答问题,而是能够使用电脑上的各种工具,真正参与到我们的学习和工作中。

此时就需要能够直接操作软件或者我们电脑的Agent软件。

演示

这篇文章当中的插图使用了 Codex 进行绘制,我将该文章的网址丢给了它(获取信息),并明确使用lan 小黑配图这个skill中的插图风格调用绘图工具进行生成(使用工具)。

1.5 什么是 Skills(技能)

一句话解释

Skills 是 AI 的"能力插件"——就像手机装 App 一样,给 AI 装上不同的 Skills,它就能做不同的事。

你的手机本身能打电话、发短信,但装了微信就能聊天,装了支付宝就能付款,装了大众点评就能找餐厅。Skills 就是 AI 的"App Store"。

SkillHub

关键知识点

  • Skills 的本质:预定义的能力模块,告诉 AI "你会做什么"以及"怎么做"

  • 与 Agent 的关系:Agent 是"大脑",Skills 是"工具箱"——Agent 决定用哪个 Skill,Skill 负责执行具体任务

  • Skills 的类型:文本处理、图像生成、代码编写、数据分析、文件操作等

一个 Skill 当中有哪些内容

  • skill.md:Agent 使用说明书,定义能力、触发条件、调用流程、输入输出规范和限制

  • README.md:面向人的项目文档,介绍用途、安装、技术架构和贡献方式

  • examples:Few-shot 示例,让 Agent 学习任务执行和输出格式

  • prompts:固化任务处理经验和推理流程的提示词模板

  • scripts:执行任务和验证结果的代码,包括处理脚本、检查脚本和测试脚本

  • config/requirements:运行所需配置和依赖

想一想

设计一个"理想中的 AI 助手":它需要哪些 Skills?画一个技能清单图。

你的日常学习生活着有没有可以抽象成 skill 的任务


本章总结

概念一句话定义关键词
LLM读过海量文本的"超级猜词器"语言理解、生成、预测
TokenAI 处理文字的最小单位计费、上下文窗口
Agent能自主思考和行动的 AI 系统规划、工具、执行
SkillsAI 的能力插件模块化、可扩展
API Key数字世界里的“电子身份证”认证、授权、计费