拓冰建站拓冰建站
首页 / 资讯中心 / 正文

理解生成式 AI 与大语言模型内部工作原理 — generative-ai-for-beginners 第 01 课技术指南

理解生成式 AI 与大语言模型内部工作原理 — generative-ai-for-beginners 第 01 课技术指南【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners本文基于 generative-ai-for-beginners 课程仓库中 01-introduction-to-genai/README.md 课程文档撰写完整覆盖生成式 AI 的技术演进脉络、大语言模型LLM的三大内部工作机制分词、逐 token 预测、基于概率分布的采样以及面向教育场景的 Prompt/Completion 四类典型用法。读完后你将能够向他人解释 LLM 为什么非确定性、如何用温度参数控制输出随机性、如何为不同的任务目标设计 prompt并知道在本课程 21 节体系中应如何继续深入。1. 课程定位与学习场景一个教育初创公司本仓库是一个包含 21 节课的生成式 AI 入门课程Generative AI for Beginners每节课覆盖一个独立主题分为讲解概念的 Learn 课和配套 Python/TypeScript 代码示例的 Build 课见 课程总览 README。第 01 课属于 Learn 类型其学习目标是理解什么是生成式 AI以及大语言模型是如何工作的学会如何针对不同用例尤其聚焦教育场景利用 LLM。课程全文以一个虚构的教育初创公司后文简称 our startup为主线其使命是在全球范围内改善学习机会的可及性确保公平获取教育并根据每个学习者的需求提供个性化学习体验。这一业务场景贯穿全课程学生拥有 24 小时在线的虚拟教师教师可以使用创新工具评估学生并给予反馈。要达成这一目标团队必须借助 LLM 这一现代最强大的工具之一。生成式 AI 之所以重要在于它降低了 AI 的使用门槛——使用者只需一句自然语言文本无需掌握 Java 或 SQL 等专门语言即可让模型完成撰写报告、编写应用等任务。本节的其余章节将依次回答三个核心问题生成式 AI 是如何一步步走到今天的LLM 的内部机制是什么我们的初创公司能把 LLM 用在哪些具体任务上2. 生成式 AI 的技术演进史尽管生成式 AI 模型的发布带来了巨大的 hype但这一技术实际上已经研发了几十年最早的研究可追溯到 20 世纪 60 年代。课程将其演进划分为四个阶段2.1 关键词触发式聊天机器人不可扩展的起点最早的 AI 原型是打字式的聊天机器人从一组专家处提取知识库并录入计算机输入文本中出现的关键词会触发知识库中的预设答案。这种方法很快被证明无法规模化——知识库需要人工穷举无法应对未见过的表达。2.2 统计式方法机器学习的转折20 世纪 90 年代统计学方法被引入文本分析催生了机器学习Machine Learning算法模型可以从数据中自行学习模式而不需要显式编程。机器可以通过文本—标签配对进行训练从而用预定义标签对未见过的输入文本进行分类——即识别消息意图。这一步让机器模拟了人类语言理解能力。2.3 神经网络与现代虚拟助手硬件算力的进步使能更大规模的数据和更复杂的计算推动了神经网络尤其是循环神经网络 RNN等深度学习算法的发展。RNN 显著增强了自然语言处理能力让文本的语义表示方式更有意义——同一个词在不同句子语境中的价值不同。这正是 21 世纪初诞生的虚拟助手所依赖的技术它们擅长解读人类语言、识别需求并执行动作如按预设脚本回答或调用第三方服务。2.4 当下Transformer 与生成式 AI生成式 AI 可以看作深度学习的一个子集其关键突破是 Transformer 架构突破 RNN 的长序列限制Transformer 能够接收比 RNN 长得多的文本序列作为输入基于注意力机制attention模型可以对输入分配不同权重更关注信息最集中的位置且不受其在序列中位置顺序的约束广泛的任务适应性大多数近期的生成式 AI 模型即 LLM因为它们处理文本输入输出都基于该架构。这些模型在海量的无标注数据书籍、文章、网站等多样来源上训练能够适应广泛的任务并生成语法正确、具有一定创造性的文本。这一突破不仅极大提升了机器理解输入文本的能力更使其具备了用人类语言生成原创回应的能力——这就是生成二字的由来。3. 大语言模型内部工作原理以 GPT 系列为例课程以 OpenAI GPTGenerative Pre-trained Transformer模型为例拆解 LLM 的三个核心机制。理解这三点是掌握后续所有 prompt 工程课程第 04 课、第 05 课的基础。3.1 Tokenizer文本如何变成数字LLM 接收文本输入、生成文本输出但作为统计模型它们对数字的运算远优于对文本序列的直接处理。因此所有输入在被核心模型使用前都会先经过一个分词器tokenizer一个token 是一小段文本由可变的字符数组成tokenizer 的核心任务是把输入切分为 token 数组每个 token 再被映射为一个token index整数编码代表原始文本片段的编号。这一机制解释了为什么 API 调用普遍按 token 计费也解释了为什么不同模型的上下文窗口context window大小不同——本质上就是模型一次能处理的 token 数上限。3.2 逐 token 预测扩展窗口式生成给定 n 个 token 作为输入最大 n 值因模型而异模型预测1 个输出 token。该 token 随即被拼接到下一轮迭代的输入末尾以扩展窗口的方式不断重复从而让用户最终读到一个完整句子或多句而不是单个词。这也解释了一个常见的用户体验现象如果你曾用过 ChatGPT可能会发现它偶尔看起来像是停在了句子中间——这正是因为模型在逐 token 地续写每一步只产出一次 token。3.3 概率分布与 temperature非确定性的来源输出 token 的选取遵循模型对当前文本序列之后各候选 token 出现概率的预测分布该分布由训练过程决定。但模型并非总是选取概率最高的 token——选取过程中加入了一定程度的随机性使模型以**非确定性non-deterministic**方式工作相同输入不一定得到完全相同的输出。这种随机性是在模拟创造性思维的过程它可以通过名为 **temperature温度**的模型参数进行调节。温度参数的实际意义是温度越低采样越趋近于总是选最高概率 token输出越稳定、越保守温度越高低概率 token 被选中的机会越大输出越发散、更有创意。这一结论与课程知识检查题的标准答案一致见 第 01 课知识检查。3.4 在本仓库中如何真正调用 LLM当你在后续 Build 课中写代码调用模型时本仓库提供了统一的客户端构造工具 shared/python/api_utils.py它印证了上述机制的落地方式create_openai_client()优先读取环境变量OPENAI_API_KEY构造 OpenAI 客户端缺失时抛出带明确提示的ValueErrorcreate_azure_openai_client()读取AZURE_OPENAI_ENDPOINT与AZURE_OPENAI_API_KEY并自动把 base_url 组装为{endpoint}/openai/v1/面向 Azure OpenAI 的 v1 端点因此无需api_version参数make_safe_request()为 HTTP 请求注入超时默认 30 秒与重试默认 3 次逻辑。配套的 shared/python/env_utils.py 提供get_required_env()、validate_env_vars()和get_env_with_default()用于安全地读取和校验环境变量例如模型名缺失时回退到默认值。从源码结构看这套工具是课程各 notebook 共用的基础设施意味着任何课程的模型调用都遵循环境变量配置密钥 → 构造客户端 → 发送 prompt的一致模式。具体环境配置步骤含本地与 Codespaces 两种方式见 00-course-setup。4. 初创公司如何用 LLMPrompt 与 Completion 的四类用法课程指出LLM 的核心能力是从自然语言文本输入出发从零生成文本。这里引入两个贯穿全课程的关键术语Prompt提示词发送给 LLM 的输入Completion补全LLM 的输出该词源自模型的机制——生成下一个 token 以补全当前输入。一个 prompt 可以包含以下形态课程为每一类都给出了教育场景中的示例4.1 指令Instruction指定你期望模型产生的输出类型指令中有时还会内嵌示例或附加数据。典型应用摘要生成对文章、书籍、产品评论等做摘要并从非结构化数据中提取洞察创意构思与写作设计文章、论文、作业等。4.2 对话式提问Question以与智能体agent对话的形式提出的问题例如学生向 AI 助教提问某个知识点的解释。4.3 待补全文本Text to complete一段隐含写作辅助请求的文本片段模型续写完成它——这直接呼应第 3.2 节的扩展窗口机制。4.4 代码Code一段代码加上解释并为其写文档的请求或者一条注释请求生成完成特定任务的代码片段。课程同时明确声明以上示例相当简单并非对 LLM 能力的穷尽展示其目的是呈现生成式 AI 的潜力在教育语境中尤为突出但不限于此。从本仓库的课程设计看这些用法正是后续课程逐节展开的起点第 04 课系统讲解 prompt 工程基础含 Jupyter Notebook 沙箱练习第 05 课讲解高级 prompt 技巧第 06 课开始动手构建文本生成应用。5. 重要局限生成式 AI 并非智能课程在这一节给出了一个必须内化的警告生成式 AI 的输出并不完美模型的创造力有时会反噬——输出可能是人类会解读为对现实的歪曲或具有冒犯性的词句组合。更具体地说生成式 AI不具备广义定义的智能它缺乏批判性推理、创造性推理与情商它不是确定性的同一输入的输出会变化见第 3.3 节它不可盲信编造fabrication——错误的引用、内容与陈述——可能混入正确信息之中并以极具说服力和自信的语气呈现。课程的处理方式是这些局限不会在本课展开而是交由 第 03 课负责任地使用生成式 AI 系统讲解——包括公平性、包容性、可靠性/安全、安全与隐私、透明性与问责六大 Responsible AI 原则以及幻觉hallucinations等危害的缓解策略。因此如何把 temperature、prompt 设计与评估手段组合起来控制输出质量是第 04、05 课与第 03 课共同回答的命题。6. 知识检查与课后练习6.1 知识检查关于大语言模型下列哪项是正确的每次都会得到完全相同的回应它做什么都很完美比如擅长加法、总能产出可运行代码即使使用相同的 prompt回应也可能不同。它擅长为你提供某个东西文本或代码的第一稿但需要你在此基础上改进。答案3。LLM 是非确定性的输出会变化但你可以通过 temperature 设置控制其变化幅度。也不应期望它完美完成任务——它的价值在于帮你完成重活给出一个好的初稿然后由你逐步打磨。6.2 课后练习Assignment课程为本节布置的练习是进一步阅读生成式 AI 的相关资料找出一个今天还没有生成式 AI、但你会希望加上的领域思考影响差异与老方式相比结果有何不同你做了之前做不到的事还是更快了写一份约 300 字的总结描述你梦想中的 AI 初创公司需包含 Problem问题、How I would use AI我将如何使用 AI、Impact影响等小标题可选地加上商业计划。这个练习把第 2 节的教育初创公司叙事交还给了读者本人——用本课学到的 prompt/completion 概念为你的场景设计第一个真实 prompt。7. 继续学习路径读完本课后建议按以下顺序推进所有路径均在本仓库内下一步内容路径第 02 课探索并对比不同 LLM 类型如何为用例选择正确的模型、测试迭代与部署02-exploring-and-comparing-different-llms/README.md第 03 课负责任地使用生成式 AI幻觉、公平性等原则与缓解措施03-using-generative-ai-responsibly/README.md第 04 课prompt 工程基础tokenization、base LLM 与 instruction-tuned LLM 的核心概念及沙箱练习04-prompt-engineering-fundamentals/README.md环境准备若要从 Learn 过渡到 Build先完成开发环境与 API 密钥配置00-course-setup/README.md第 02 课将延续本课建立的术语体系foundation model、LLM、多模态模型帮助你理解选型决策从文本生成、音频、图像到多模态不同任务适合不同类型的模型并按任务质量、延迟、上下文窗口、工具调用能力、安全行为、区域可用性与总成本来比较而非仅看发布日期或价格。要点回顾生成式 AI 的演进路径关键词聊天机器人 → 统计式机器学习 → 神经网络/RNN 虚拟助手 → Transformer 驱动的 LLMLLM 三步内部机制tokenizer 将文本编码为 token index → 逐 token 预测并以扩展窗口续写 → 从概率分布中采样temperature 调节随机性prompt 的四种基本形态指令、对话提问、待补全文本、代码覆盖摘要、创意写作、问答与代码生成等教育场景LLM 非确定性、不完美、不可盲信编造内容会混入正确信息——质量与责任问题由第 03、04、05 课接力解决本仓库后续课程与共享工具shared/python/api_utils.py、shared/python/env_utils.py为把上述概念落地为可运行的 Python/TypeScript 应用提供了统一基础设施。【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门