WEEK 02 · 基础认知阶段

LLM工作原理与技术基础

深入Transformer核心架构,理解"注意力就是一切"的革命性突破,掌握大语言模型从训练到推理的完整链路

🔴 重点 🟡 难点
🏗️
MODULE 01
Transformer架构解析

📄 "Attention Is All You Need"(2017)

Google团队发表的这篇论文彻底改变了NLP领域。Transformer抛弃了RNN的序列处理方式,完全基于注意力机制,实现了真正的并行计算。

👁️
自注意力(Self-Attention)
每个词都能直接"看到"序列中所有其他词,计算彼此的关联权重。就像阅读一篇文章时,你的大脑会自动将"它"与前文提到的具体事物关联起来
🔀
多头注意力(Multi-Head Attention)
同时从多个视角理解序列 — 一个头关注语法关系,一个头关注语义关联,一个头关注指代关系。多维度并行理解
📍
位置编码(Positional Encoding)
由于注意力机制本身不关注顺序,位置编码通过正弦函数为每个位置注入序列信息,让模型知道"谁在前谁在后"

⚡ 为什么Transformer胜出?

对比维度RNN / LSTMTransformer
计算方式顺序处理,逐词计算并行处理,全局关注
长距离依赖信息衰减严重直接连接任意位置
训练效率无法并行,速度慢高度并行,数量级提升
可扩展性难以扩展到大规模支持千亿参数级扩展
📈
MODULE 02
GPT家族演进:从1.17亿到万亿参数

🧬 GPT进化路线

1
GPT-1(2018)· 1.17亿参数
首次验证"预训练+微调"范式的有效性,基于BookCorpus数据集训练
2
GPT-2(2019)· 15亿参数
远超时代的文本生成能力,因"过于危险"延迟发布,引发AI安全讨论
3
GPT-3(2020)· 1750亿参数
展现少样本学习(Few-Shot)能力,商业化API推出,引爆大模型竞赛
4
GPT-4(2023)· 多模态架构
支持文本+图像输入,多项基准接近人类水平。ChatGPT Plus / Copilot 落地
MODULE 03
涌现能力与预训练范式

🌊 什么是涌现能力?

关键概念
当模型参数量达到某个临界点后,突然出现训练时未明确教授的新能力 — 如逻辑推理、代码生成、多步骤问题分解。这是量变引起质变的典型案例。

🔄 预训练→微调→对齐 三阶段

📚
预训练(Pre-training)
在海量文本上进行自监督学习,习得语言的统计规律和世界知识。核心任务:预测下一个词(Next Token Prediction)
🎯
指令微调(Instruction Fine-tuning)
使用高质量指令-回答数据集进行有监督微调(SFT),让模型学会"听懂"人类指令
⚖️
人类偏好对齐(RLHF)
通过人类反馈的强化学习,使模型输出与人类价值观对齐 — 更有帮助、更真实、更安全
🌐
MODULE 04
全球大模型竞争格局

🏢 主要玩家一览

机构代表模型特色
🇺🇸 OpenAIGPT-4 / ChatGPT多模态、商业化标杆
🇺🇸 GoogleGemini多模态融合、搜索集成
🇺🇸 AnthropicClaude安全对齐、长上下文
🇨🇳 百度文心一言中文优化、行业落地
🇨🇳 阿里通义千问开源生态、工具集成
🇨🇳 DeepSeekDeepSeek-V3开源高性价比、推理能力

🤔 传媒人应如何看待?

核心结论
LLM不是要取代传媒人,而是成为传媒人的"超级工具"。核心竞争力在于:
① 提出正确的问题(批判性思维)
② 判断输出的质量(专业素养)
③ 承担内容的责任(职业伦理)
← PREV WEEK
课程导论与AI基础