1.1 什么是 LLM(大语言模型)
一句话解释
LLM (Large Language Model)就像是一个读完了全人类海量文章的‘超级复读机’。它并不真正懂得这些话的意思,只是基于前面给定的文字,预测下一个最可能的词(token)。
大模型是怎么训练的
大语言模型的核心训练任务可以概括为:
根据前面的内容,预测下一个最可能出现的 Token。
听起来很简单,但只要训练数据足够多、模型参数足够大,这个任务就能让模型逐渐学会语言、知识、代码结构和常见的推理模式。
如果你感兴趣的话可以去读《Attention is all you need》以深入的了解 Transformer,这当然** **不在我们第0节AI课的分享范围内。
为了让大家更好的了解 LLM 是怎么工作的,接下来会简单讲解一下模型是如何训练的(为了尽可能简化,大部分细节被忽略了,甚至不一定对🤡但你理解了就好
-
第一步:收集、清洗与整理数据
训练大模型之前,需要收集和整理大量数据,例如:网页、书籍、新闻、百科、论文……
收集到的原始数据不能直接全部用于训练,还需要进行清洗。
常见处理包括但不限于:过滤低质量内容、去除部分隐私信息
高质量的数据对于模型的训练极为重要(对人来说也很重要啊)
如果训练数据中充满错误、重复或低质量内容,模型也更容易学到错误模式。
-
第二步:把文字切成 Token
大模型不能直接处理人类看到的文字,需要先把文字转换成数字。
这个过程叫作 Tokenization,可以理解为将文本拆分成模型能够处理的标记。
例如:
我喜欢人工智能可能被拆成:
我 | 喜欢 | 人工 | 智能也可能被拆成:
我 | 喜 | 欢 | 人工智能具体如何拆分,取决于模型使用的 Tokenizer。
每个 Token 都会对应一个编号,例如:
我 → 1042 喜欢 → 5738 人工智能 → 18924模型实际接收到的不是文字,而是一串数字:
[1042, 5738, 18924]所以大模型的上下文长度和 API 使用费用通常按照 Token 计算,而不是简单按照字数计算。
-
第三步:把文本变成“预测题”
例如,原始句子是:
我喜欢吃苹果系统可以把它转换成类似下面的训练任务:
看到“我” → 预测“喜欢” 看到“我喜欢” → 预测“吃” 看到“我喜欢吃” → 预测“苹果”一段普通文字,可以被拆成许多道“预测下一个 Token”的题目。
再例如,训练数据中有一句话:
天空是蓝色的模型看到:
天空是,然后为下一个 Token 计算概率,例如:蓝色:65% 晴朗:12% 灰色:8% 美丽:5% 其他:10%正确答案是“蓝色”,如果模型给“蓝色”的概率很高,说明预测得比较好;如果模型认为“香蕉”最可能出现,说明预测得很差。
-
第四步:计算模型错了多少
训练系统会比较模型的预测与正确答案之间的差距。
这个差距通常称为:
损失值(Loss)
可以简单理解为:
预测越准确 → Loss 越小 预测越离谱 → Loss 越大Loss 是训练程序用来判断模型当前表现的重要指标。
-
第五步:根据错误调整模型参数
模型内部包含大量参数。
这些参数不是一条条人工编写的规则,而是大量数字。它们共同影响模型看到某些内容时,接下来更倾向于输出什么。
模型预测完成后,训练程序会根据 Loss 调整参数,使模型下一次更容易预测出正确答案。
初学阶段不需要理解其中的数学细节,只需要知道:
模型每预测错一次,训练程序就会稍微调整模型内部的数字,使下一次预测更接近正确答案。
整个过程可以简化为:
输入文本 ↓ 预测下一个 Token ↓ 与正确答案比较 ↓ 计算 Loss ↓ 调整模型参数 ↓ 继续训练
-
第六步:在海量数据上反复训练
模型会在大量文本中不断进行下一个 Token 预测。例如:
中国的首都是 → 北京 1 + 1 = → 2 春眠不觉晓 → 处处闻啼鸟 function add(a, b) { → return a + b;经过海量训练后,模型会逐渐学到:
-
词语之间的关系
-
句子的常见结构
-
不同概念之间的关联
-
模型选择
单模态:过去的 AI 只能处理单一的“文本”输入和输出(纯聊天、写代码)。
多模态(Multimodal):“模态”指信息的表达形式(如文字、图片、音频、视频)。多模态 AI 意味着打通了视听感官,你可以发一张手写高数题的照片让它解析,或者直接用语音和它流畅对答。
为什么一些纯文本模型(比如 DeepSeek v4 系列)也能接受图片、pdf等输入? 软件厂商在大模型前面套了一层ocr工具,将图片中的文字内容提取出来再传给大模型,对手写字迹和图片理解场景很不友好,当然在编程、数学推理、文字写作方面适用。
大模型的记忆是“假的”
前文我们说到 LLM 是一个猜词器,只是在预测"接下来最可能说什么"。那么我们在和 AI 聊天时,大模型是怎么做到**“记住”**对话中刚才说过的事,甚至是跨对话把你的喜好记下来,这不就是“记忆”吗?
其实,这是 AI 软件开发者为 LLM 设计的“伪记忆机制”。当前对话中,软件会把历史聊天记录拼在提示词里一同传入;而跨对话的“记忆”,则是软件将你的偏好提取成用户画像,存入外部数据库。
当你新开一个对话,问AI “我是谁,有什么喜好”,传入大模型的不只有你当下的问题,还包括一个由软件组装好的“完整上下文”。这里面通常包含三部分:
-
系统提示词(AI的人格):定义AI自身身份和行为规则,比如“你的名字是豆包,逻辑清晰,思维缜密...”。
-
用户画像(关于你的记忆):从你历史对话中提炼出的个人档案,比如“用户是一个大学生,家里有一只小猫...”。这些内容被保存在 AI 软件的云端服务器当中。
-
历史对话(当前的上下文):你们刚刚聊过的内容。当上下文过长时,软件会对其进行压缩或摘要处理,将有用的部分传入大模型进行下一轮的推理
这三部分会被拼接成一段长文本,一起喂给大模型做推理(也就是我们前文说到的“猜词”)。模型“看到”了这些信息,才能给出有针对性的回答。一旦这次推理结束,它又会回到“无状态”的初始状态。
豆包的系统提示词(来源:oiuv/system_prompt):
你的名字是豆包,逻辑清晰,思维缜密。
你能精准解读问题、分析问题,回答时尽可能丰富、详尽、深入,并在关键问题上做延展回答,给出一些例子说明。
你在写文案和主题创作时,会基于用户的创作要求提供文案参考,数量尽可能多,且类型丰富,并根据用户需求适当调整文案字数的长短。
回答时请始终保持逻辑严谨,表述专业,结构清晰,分段准确,并会正确使用 Markdown 格式。
今天的日期:2024 年 8 月 7 日 星期三模型幻觉
大模型会尽可能的完成任务,有的时候让它了解到不会的东西可以直接说不会,可以降低 AI 幻觉出现的概率。并且尽可能给AI提供更多的背景信息,更多工具(包括但不限于联网搜索)
案例-洗车店离我只有50米,走路去还是开车去?
思考一下-LLM知道自己是谁吗?
1.2 什么是 API Key
API Key(接口密钥)就像是你在数字世界里的“电子身份证”或“专属钥匙”。 当你想用代码或者第三方工具去调用某个 AI 服务(比如把Mimo、Deepseek接到Agent工具或者自己的网页里)时,这个服务商需要通过 API Key 来辨别:“你是谁”以及“你有没有权限/额度来用我的服务”。
Base URL通常与API KEY一起出现,它解决的是请求发往哪里的问题。它其实就是一串网址。区分你调用的服务商是谁,靠的就是Base URL。
打个比方
在学校里,你要想使用校园网,通常需要两步:
-
连哪个网络? 学校有两个不同的 WiFi通道:
Teacher_WiFi,Student_WiFi。你作为的学生的身份需要选择Student_WiFi。—— 这就是 Base URL,决定了你的请求发往哪个服务端。它是一个公开的通道,告诉你“从这里可以连进去”。 -
连上之后,手机会弹出一个登录页面,要求你输入学号和密码。—— 这就是 API Key(密钥)。
学校的服务器看到你输入的学号和密码正确,就会做两件事:
-
认证与授权:确认你是本校学生,一键放行,让你成功上网。
-
计费与扣流量:开始统计你用了多少兆流量(在 AI 里就是消耗了多少 Token),并从你的校园卡账户里扣除相应的费用。
演示-获得一个你自己的 API key
注册DeepSeek开放平台账号并充值(可以充10元试试,不用来编程的话能用超级久),在 API Keys 页面右上角创建一个key,名称随便取一个,方便后续管理多个key(不同项目的Key分开可以方便查看每个项目的模型用量)。 另外一定不要将你的 API Key 直接写在程序当中发给别人,API Key 泄漏以后可以在开放平台面板上将其删除。下文为了方便演示直接写在了程序中,具体怎么保护你的 Key 你可以问问 AI。
| 管理API Key | 调用文档 |
|---|---|
前往 DeepSeek API 文档 查看 base_url 与可使用的模型名称,往下滑还能看到脚本样例。这里我使用 python 进行演示,代码我进行了简化的修改。如果你也想试试跟着运行一下代码,需要先保证你安装了 python 和 OpenAI SDK。
通过 Python 调用 API 并演示大模型并不知道自己是谁
在终端当中输入pip3 install openai 来安装OpenAI SDK。(无法正常下载的可以问问 AI 怎么解决,提示词中可以提到“镜像”这个关键词)
| 安装OpenAI SDK | “我是谁?” |
|---|---|
这边我演示了将豆包的系统提示词传给了 deepseek-v4-flash,它马上扮演起了豆包。
你可以动手试试大模型是否存在记忆
在 TRAE WORK 当中填写自定义模型
| TRAE 模型提供商设置 | 自定义模型设置 |
|---|---|
很多Agent软件中,有模型的预设,只需要填写API Key就可以添加使用了。如果预设当中没有你订阅或充值的模型厂商,可以选择自定义配置,填写在接口文档当中获取的Base URL、API Key 和 模型名称。
1.3 什么是 Token(词元)
一句话解释
Token 是 AI 处理文字的最小单位,就像乐高积木是搭建模型的最小零件;Token 也是一个计价单位,比如mimo-v2.5的每百万Tokens输出是2元。
关键知识点
-
Token 不等于字:中文里,一个汉字通常占 1-2 个 Token;英文里,一个单词可能占 1-3 个 Token
-
为什么重要:API 调用按 Token 计费,理解 Token 能帮你省成本
-
上下文窗口:每个模型有 Token 上限(如 8K、128K、1M),超出就会"忘记"前面的内容
-
不同模型同一段话的Token数不一样:一个词组或字在训练语料当中出现次数越少,其占用的 Token 数可能越多。
演示
-
使用在线 Token 计数器(如 Tiktokenizer),输入不同长度的文本,观察 Token 数量变化
-
对比中英文同一内容的 Token 差异
你好,我是一个 AI 助手。今天我来帮你了解 Token 是什么。
Token 是大语言模型处理文本的基本单位。对于英文,一个 Token 大约是 4 个字符或 3/4 个单词。对于中文,一个汉字通常对应 1-2 个 Token。
Here's an example in English: "Hello, world!" might be tokenized as ["Hello", ",", " world", "!"].
费用计算公式: 总费用 = (输入Token × 输入单价) + (输出Token × 输出单价)
想一想
为什么 AI 不能正正好输出800字的文章?
1.4 什么是 Agent(智能体)
一句话解释
Agent 是一个能自主思考、规划、使用工具来完成任务的 AI 系统
Agent = 大模型(大脑) + 记忆系统(记忆) + 工具(手脚) + 规划
生活类比
普通 AI 像一个只能回答问题的客服;Agent 像一个能帮你订机票、查天气、写报告、发邮件的私人助理。它能拆解任务、调用不同工具、自己检查结果。
或许你日常使用的都是一个基础的Agent
前文我们提到,LLM 的核心机制是根据上下文预测下一个 Token。它拥有强大的语言理解和生成能力,但本身不会主动获取外部信息,也不会主动执行任务。 那豆包、千问等 AI 助手是如何回答“最近天气怎么样”“六级考试报名时间是什么时候”这类需要实时信息的问题? 答案是:AI 可以调用搜索、数据库等外部工具获取信息,并将这些内容作为额外上下文提供给 LLM。基于更准确的信息,LLM 就能生成更加可靠的回答。 这就是 Agent 的基本思想:让大模型不仅会“回答”,还能够“行动”。
关键知识点
-
Agent vs LLM:LLM只能对话(预测下一个Token),Agent 能行动
-
核心能力:感知(获取信息)→ 思考(分析决策)→ 行动(使用工具)→ 反馈(检查结果)
-
生活中的 Agent:Siri、小爱同学是早期的智能助手;Codex、OpenClaw是更高级的 Agent
-
Agent 和工作流的区别:工作流:按照预先设计好的步骤执行任务; Agent:能够根据目标自主决定下一步行动,例如选择工具、查询知识库或调整执行策略。
-
现在大家说的 Agent 一般是可以帮忙编写代码、处理电脑文件的软件
为什么不在网页上使用 AI ?
如果你想用AI来解决除了写作、聊天、查资料以外的“生产力”问题时,你会接触到 WorkBuddy、openclaw 这样的 Agent 软件,它们都需要被安装在一台电脑上。
很多时候,AI 只负责“告诉你怎么做”,真正动手的还是你。
比如你想让 AI 帮你整理一份课程资料。
普通 AI 的过程可能是:
-
你打开课程群,将所有的课程资料下载下来
-
把所有的文件拖到 AI 网页中
-
AI 帮你整理
-
你再把结果复制出来
-
打开 Word 或 Notion
-
自己保存
这时候,你其实在充当 AI 和电脑之间的“搬运工”。
而 Agent 想做的是:
你只告诉它:“帮我把xxx这门课的课程资料整理好。资料全在飞书课程群当中”
然后它自己去调用飞书的能力,将文件下载到电脑本地、整理内容、创建文档并保存。
给我完整的代码
在之前很多人用AI来写代码的方式是:让AI写一段,复制出来粘到编辑器当中,检查有没有问题。
出了bug就将报错信息复制发给 AI ,然后AI再给你修改方式。对于很多人来说代码基础不行或者根本没有耐心看AI给的修改建议,就直接发给我完整的代码希望能够直接复制粘贴,放空大脑。
我们希望 AI 不只是待在聊天框里回答问题,而是能够使用电脑上的各种工具,真正参与到我们的学习和工作中。
此时就需要能够直接操作软件或者我们电脑的Agent软件。
演示
这篇文章当中的插图使用了 Codex 进行绘制,我将该文章的网址丢给了它(获取信息),并明确使用lan 小黑配图这个skill中的插图风格调用绘图工具进行生成(使用工具)。 |
1.5 什么是 Skills(技能)
一句话解释
Skills 是 AI 的"能力插件"——就像手机装 App 一样,给 AI 装上不同的 Skills,它就能做不同的事。
你的手机本身能打电话、发短信,但装了微信就能聊天,装了支付宝就能付款,装了大众点评就能找餐厅。Skills 就是 AI 的"App Store"。
关键知识点
-
Skills 的本质:预定义的能力模块,告诉 AI "你会做什么"以及"怎么做"
-
与 Agent 的关系:Agent 是"大脑",Skills 是"工具箱"——Agent 决定用哪个 Skill,Skill 负责执行具体任务
-
Skills 的类型:文本处理、图像生成、代码编写、数据分析、文件操作等
一个 Skill 当中有哪些内容
-
skill.md:Agent 使用说明书,定义能力、触发条件、调用流程、输入输出规范和限制
-
README.md:面向人的项目文档,介绍用途、安装、技术架构和贡献方式
-
examples:Few-shot 示例,让 Agent 学习任务执行和输出格式
-
prompts:固化任务处理经验和推理流程的提示词模板
-
scripts:执行任务和验证结果的代码,包括处理脚本、检查脚本和测试脚本
-
config/requirements:运行所需配置和依赖
想一想
设计一个"理想中的 AI 助手":它需要哪些 Skills?画一个技能清单图。
你的日常学习生活着有没有可以抽象成 skill 的任务
本章总结
| 概念 | 一句话定义 | 关键词 |
|---|---|---|
| LLM | 读过海量文本的"超级猜词器" | 语言理解、生成、预测 |
| Token | AI 处理文字的最小单位 | 计费、上下文窗口 |
| Agent | 能自主思考和行动的 AI 系统 | 规划、工具、执行 |
| Skills | AI 的能力插件 | 模块化、可扩展 |
| API Key | 数字世界里的“电子身份证” | 认证、授权、计费 |