dev.to #ai短讯
想真正理解LLM工作原理?斯坦福免费课程可能是最佳起点
文章推荐斯坦福大学关于大语言模型(LLM)工作原理的免费课程,旨在帮助读者深入理解模型背后的机制,而非仅停留在表面认知。
โดย Nokka (นก-กา) | 9 ตุลาคม 2026
บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์ · Nokka (นก-กา)
ทุกวันนี้เราคุยกับแชตบอตทุกวัน แต่มีกี่คนที่ตอบได้ว่ามันทำงานยังไงจริง ๆ?
ไม่ใช่คำตอบระดับที่ว่า "มันเดาคำถัดไป" แบบที่ใครก็พูดได้ แต่ต้องรู้ว่าทำไมมันเดาได้ และทำไมบางทีนึกไม่ออก
ถ้าคำถามนี้ค้างอยู่ในหัวคุณ มีคอร์สหนึ่งที่ตั้งใจตอบคำถามนี้ทั้งชุด และเปิดให้ดูฟรี
คอร์สนี้คืออะไร และใครสอน
Stanford เปิดสอนรายวิชา CME 295: Transformers & Large Language Models โดยบันทึกทุกคาบขึ้น YouTube ให้ดูฟรี[1]
คาบแรกของรุ่น Autumn 2026 ยาว 1 ชั่วโมง 44 นาที และมียอดดูเกิน 372,000 ครั้งแล้ว ณ วันที่เขียนบทความนี้[2]
ชื่อวิชาในหลักสูตร CME ย่อมาจาก Computational and Mathematical Engineering ซึ่งเป็นสายวิศวกรรมเชิงคำนวณของมหาวิทยาลัย
ผู้สอนคือสองแฝดที่ผ่านเส้นทางเดียวกัน
ผู้สอนคือ Afshine Amidi และ Shervine Amidi สองพี่น้องฝาแฝดที่เรียนด้วยกันมาตลอดทาง
ทั้งคู่จบจาก Ecole Centrale Paris ในฝรั่งเศส แล้วแยกกันไปเรียนต่อระดับปริญญาโทที่อเมริกา โดย Afshine ไป MIT ส่วน Shervine ไป Stanford[3]
หลังจากนั้นทั้งคู่เข้า Uber แล้วไป Google ก่อนจะย้ายมาอยู่ Netflix ด้วยกันทั้งสองคน[2]
พวกเขาสอนเนื้อหานี้มาตั้งแต่ปี 2021 ในหลายรูปแบบ ก่อนจะยกระดับเป็นวิชาจริงของ Stanford เมื่อปีที่แล้ว และรุ่นนี้เป็นรุ่นที่สามตามที่ผู้สอนกล่าวไว้ในคลิป[2]
ไม่มี homework แต่มีข้อสอบสองครั้ง
จุดที่ต่างจากวิชามหาวิทยาลัยทั่วไปคือคอร์สนี้ ไม่มีการบ้านเลย คะแนนมาจากการสอบสองครั้ง คือ midterm กับ final[2]
midterm จะออกเนื้อหาสี่คาบแรก และจัดวันที่ 23 ตุลาคม 2026 ส่วน final จะออกเนื้อหาห้าคาบหลัง และจัดวันที่ 9 ธันวาคม 2026 รวมทั้งหมดเก้าคาบ[4]
คาบเรียนจัดทุกวันศุกร์ เวลา 15.30 ถึง 17.20 น. แต่ถ้าอยู่ต่างประเทศหรือเวลาไม่สะดวก ก็ดูย้อนหลังได้ทั้งหมด[1]
สไลด์ถูกโพสต์ล่วงหน้าหนึ่งวันก่อนคาบเรียน เพื่อให้ผู้เรียนพิมพ์จดบนสไลด์ได้ตามที่อาจารย์บอกว่าเป็นคำขอจากผู้เรียนรุ่นก่อน[2]
เส้นทางจาก RNN สู่ Transformer ที่คอร์สอธิบาย
คาบแรกใช้เวลาส่วนใหญ่ไปกับการตอบคำถามข้อหนึ่ง คือทำไมเรามาถึงจุดนี้
ผู้สอนย้อนไปเมื่อราวสิบปีก่อน ตอนที่วงการนี้ยังไม่มีโมเดลเดียวที่ทำได้ทุกอย่าง แต่มีโมเดลแยกกันตามงาน งานวิเคราะห์อารมณ์ก็มีโมเดลหนึ่ง งานแปลก็มีอีกโมเดล งานหาชื่อคนและสถานที่ก็มีอีกโมเดล[2]
โมเดลที่ครองวงการตอนนั้นคือ RNN หรือโครงข่ายประสาทแบบวนซ้ำ ซึ่งเรียนรู้จากลำดับของคำทีละคำ
แล้วทุกอย่างก็เปลี่ยนในปี 2017
กระดาษแผ่นเดียวที่เปลี่ยนทิศทางวงการ
ปี 2017 มีบทความวิจัยชื่อ Attention Is All You Need ที่เสนอสถาปัตยกรรมใหม่ชื่อ Transformer และกลายเป็นจุดเปลี่ยนของทั้งวงการ[5]
เหตุผลที่มันเปลี่ยนเกมไม่ได้อยู่ที่ผลลัพธ์ที่ดีขึ้นเท่านั้น แต่เพราะมัน ปรับขนาดได้
คำว่าปรับขนาดได้ในที่นี้หมายถึง ถ้าเราเพิ่มข้อมูล เพิ่มพลังประมวลผล และเพิ่มขนาดโมเดล ผลลัพธ์ที่ได้จะดีขึ้นในอัตราที่สูงกว่าเดิมมาก ซึ่งเป็นคุณสมบัติที่สถาปัตยกรรมก่อนหน้าไม่มี[2]
จากโครงสร้างนั้น วงการก็ขยายมันขึ้นเรื่อย ๆ ทั้งขนาดโมเดลและปริมาณข้อมูลที่ใช้ฝึก จนกลายเป็นโมเดลภาษาขนาดใหญ่ที่เรารู้จักทุกวันนี้
ผู้สอนไล่ไทม์ไลน์ต่อว่าเดือนพฤศจิกายน 2022 มีการเปิดตัว ChatGPT ซึ่งเป็นจุดเปลี่ยนอีกชั้นในมุมของผลิตภัณฑ์ เพราะเป็นครั้งแรกที่คนทั่วไปได้คุยกับแชตบอตจริง ๆ[2]
และมาถึงปี 2026 นี้ ผู้สอนคาดว่าผู้เรียนเกือบทุกคนใช้ coding agent เกือบทุกวัน ซึ่งเป็นคำถามที่คอร์สจะตอบในครึ่งหลังว่าจากผู้ช่วยคุยเล่น กลายเป็นเอเจนต์ที่ลงมือทำงานได้ยังไง[2]
สี่แนวคิดหลักที่คอร์สสอนในคาบแรก
Tokenization คือจุดเริ่มของทุกอย่าง
โมเดลไม่เข้าใจตัวอักษร มันเข้าใจตัวเลข
ดังนั้นขั้นแรกคือการแบ่งข้อความออกเป็นหน่วยย่อยที่เรียกว่า โทเคน แล้วแทนแต่ละหน่วยด้วยตัวเลขที่เรียกว่าเวกเตอร์[2]
คอร์สยกตัวอย่างง่าย ๆ ว่า ประโยค "a cute teddy bear is reading" อาจถูกแบ่งเป็นหกโทเคน โดยที่คำว่า teddy bear รวมกันเป็นหนึ่งหน่วย
แล้วทั้งชุดโทเคนที่โมเดลรู้จักก็เรียกรวมกันว่า vocabulary ซึ่งในโมเดลสมัยใหม่มีขนาดหลักแสน โดยผู้สอนบอกว่าอยู่ราว 200,000 โทเคน[2]
สามวิธีแบ่งคำ ที่มีข้อดีข้อเสียต่างกัน
แบ่งตามคำ ง่ายและอธิบายได้ แต่มีปัญหาสามข้อ คือคำที่แปรรูปเยอะทำให้ vocabulary บวม, คำที่มีรากเดียวกันไม่ได้ใช้ความรู้ร่วมกัน เช่น bear กับ bears, และเสี่ยงเจอคำที่ไม่เคยเห็นตอนฝึก[2]
แบ่งตามตัวอักษร แก้ปัญหาไม่รู้จักคำได้ เพราะตัวอักษรมีจำกัด แต่ลำดับจะยาวขึ้นมาก ทำให้ประมวลผลช้าลง และเวกเตอร์ที่ได้ก็ตีความยากกว่า[2]
แบ่งตามหน่วยย่อยของคำ (subword) เป็นวิธีที่ครองวงการตอนนี้ เพราะได้ทั้งรากคำและขนาดที่สมดุล[2]
วิธีที่นิยมที่สุดในกลุ่มนี้คือ BPE หรือ Byte Pair Encoding ซึ่งเริ่มจากชุดโทเคนตั้งต้น แล้วนับคู่ที่ปรากฏบ่อยที่สุดมาหลอมรวมเป็นโทเคนใหม่ ทำซ้ำไปเรื่อย ๆ จนได้ขนาด vocabulary ตามที่ต้องการ[2]
ผู้สอนย้ำว่าถ้าทำงานหลายภาษา ต้องมั่นใจว่าคลังข้อความที่ใช้ฝึก tokenizer มีทุกภาษาที่เราสนใจ
เวกเตอร์ของคำที่เรียนรู้ความหมาย
เมื่อได้โทเคนแล้ว คำถามต่อไปคือจะแทนมันด้วยอะไร
วิธีที่ตรงไปตรงมาที่สุดคือ one-hot encoding คือให้แต่ละโทเคนเป็นเวกเตอร์ที่มีเลขหนึ่งตัวเป็น 1 และที่เหลือเป็น 0
แต่ผู้สอนชี้ว่าวิธีนี้ไม่ดี เพราะเวกเตอร์ทุกตัวจะตั้งฉากกันหมด มันไม่บอกอะไรเลยว่าโทเคนไหนใกล้เคียงกัน[2]
เราต้องการเวกเตอร์ที่บอกได้ว่า teddy bear ใกล้เคียงกับ soft เพราะหมีนุ่ม แต่ book ไม่เกี่ยว
แนวคิดนี้ถูกทำให้จริงด้วยวิธีชื่อ word2vec ซึ่งเรียนรู้ผ่านงานตัวแทน ไม่ใช่งานที่เราต้องการโดยตรง งานตัวแทนในเวอร์ชัน CBOW คือการเดาคำที่อยู่ตรงกลางจากคำรอบข้าง ส่วนเวอร์ชัน skip-gram คือการเดาคำรอบข้างจากคำตรงกลาง[2]
ผลลัพธ์ที่ได้น่าสนใจกว่าที่คิด เพราะชั้นกลางของโครงข่ายที่เรียนรู้ขึ้นมา กลับจับความสัมพันธ์เชิงความหมายได้จริง อย่างความสัมพันธ์แบบ ปารีสคือกับฝรั่งเศส เหมือนที่เบอร์ลินคือกับเยอรมนี[2]
ข้อจำกัดของ word2vec ที่ต้องมีอย่างอื่นมาแก้
ผู้เรียนในห้องช่วยกันตอบข้อจำกัดของวิธีนี้ และได้คำตอบที่ตรงประเด็นสามข้อ
ข้อแรกคือคำที่ต่างความหมายแต่สะกดเหมือนกันจะได้เวกเตอร์เดียวกัน ตัวอย่างคลาสสิกที่ผู้สอนยกคือ bank ที่แปลว่าธนาคารกับตลิ่งริมแม่น้ำ[2]
ข้อสองคือลำดับคำไม่มีความหมาย ประโยค "เด็กกอดหมี" กับ "หมีกอดเด็ก" ใช้คำชุดเดียวกันแต่ความหมายต่างกัน วิธีนี้ให้ผลเท่ากัน[2]
และข้อสามคือคำที่ไม่เคยเจอตอนฝึกจะไม่มีเวกเตอร์ให้ใช้
นี่คือเหตุผลที่ทำให้ต้องมี RNN เข้ามา ซึ่งเพิ่มสถานะซ่อนที่จำความหมายของประโยคที่อ่านมาแล้ว เพื่อให้ลำดับคำมีความหมาย[2]
แต่ RNN ก็มีข้อจำกัดของตัวเอง นั่นคือจำคำที่อยู่ไกลเกินไปไม่ได้ ซึ่งผู้สอนอธิบายว่ามาจากปัญหาเชิงลึกที่เรียกว่า vanishing gradient[2] และถึงแม้จะมีการพัฒนาต่อเป็น LSTM ที่เพิ่มหน่วยความจำอีกชั้น ก็ยังแก้ปัญหาได้ไม่หมด[2]
หัวใจของ Transformer อยู่ที่สูตรเดียว
ทางออกของปัญหาข้างต้นคือแนวคิดที่เรียกว่า attention หรือการให้ความสนใจ
แทนที่จะให้โมเดลพึ่งสถานะซ่อนเพียงอย่างเดียวเพื่อจำอดีต แนวคิดใหม่คือให้โทเคนแต่ละตัวเชื่อมตรงไปยังโทเคนก่อนหน้าได้เลย แล้วให้โมเดลเรียนรู้เองว่าโทเคนไหนสำคัญกับโทเคนไหน[2]
พอรวมแนวคิดนี้เข้ากับการให้โทเคนทุกตัวปฏิสัมพันธ์กันทั้งหมด เราได้สิ่งที่เรียกว่า self-attention ซึ่งเป็นแกนของ Transformer
Query, Key และ Value
การอธิบายกลไกนี้ใช้คำสามคำที่ฟังดูแปลกตอนแรก
Query คือสิ่งที่โทเคนหนึ่งกำลังถามว่า "ฉันควรสนใจใคร" ส่วน Key คือป้ายที่โทเคนแต่ละตัวติดไว้เพื่อให้คนอื่นเทียบ และ Value คือเนื้อหาจริงที่จะถูกดึงมาผสมกัน
ผู้สอนยกตัวอย่างว่าถ้าเราอยากรู้ว่าอะไรอธิบายหมีตัวนี้ได้ดี query ของ teddy bear จะเทียบกับ key ของทุกโทเคน แล้วพบว่า cute ใกล้เคียงที่สุด ดังนั้น representation ของ teddy bear จะขึ้นกับ cute เป็นหลัก[2]
ทั้งหมดนี้เขียนเป็นสูตรได้กระชับมาก
import math
def self_attention(Q, K, V):
# เทียบ query ทุกตัวกับ key ทุกตัว ด้วย dot product
scores = Q @ K.T / math.sqrt(K.shape[-1])
# แปลงเป็นน้ำหนักที่รวมกันได้ 1
weights = softmax(scores)
# ถ่วงน้ำหนัก value แล้วรวม
return weights @ Vผู้สอนบอกตรง ๆ ในคลิปว่า นี่คือสูตรที่สำคัญที่สุดของ Transformer และใบ้ด้วยว่ามันเคยออกข้อสอบ midterm มาก่อน[2]
จุดที่ต้องเข้าใจคือการหารด้วยรากที่สองของมิติ key เพราะถ้าไม่หาร ค่าที่ได้จะแปรปรวนเกินไปตามขนาดมิติ ทำให้การกระจายน้ำหนักไม่ดี[2]
ส่วนประกอบที่เหลือในสถาปัตยกรรม
คอร์สไล่องค์ประกอบที่เหลือของ Transformer ต่อ โดยเริ่มจาก position embedding ที่บวกเข้าไปกับ embedding ของโทเคน เพื่อให้โมเดลรู้ว่าคำไหนอยู่ตำแหน่งไหน[2]
ผู้สอนอธิบายว่าการแทนตำแหน่งมีสองแนวทาง คือเรียนรู้จากข้อมูล กับใช้ฟังก์ชันคณิตศาสตร์อย่างไซน์และโคไซน์ที่ความถี่ต่างกัน
แนวทางหลังมีคุณสมบัติที่ดีคือ ตำแหน่งที่ใกล้กันจะได้ค่าใกล้กัน และไม่มีข้อจำกัดเรื่องความยาวข้อความเหมือนแบบที่เรียนรู้[2]
讲师用生动的比喻解释道,这就像是一个由不同频率的时针、分针和秒针组成的钟表,当它们协同运作时,我们就能获得精准的时间[2]。
课程中提到的其他组件包括:用于构建源文本表示的编码器(encoder),用于逐个令牌生成目标文本的解码器(decoder),有助于深层模型更好学习的残差连接(residual connection),以及加速收敛的层归一化(layer normalization)。此外,还有在解码器中屏蔽部分连接以防止模型窥视尚未可见的词汇,多头注意力机制(multi-head attention)则并行执行八组子任务,每组拥有独立的查询/键/值(Q/K/V),使模型能够从多个角度进行观察。同时还包括防止模型过度依赖单一特征的 Dropout 技术,以及降低答案过度自信程度的标签平滑(label smoothing);这两者均有助于模型更好地处理新数据[2]。
讲师特别强调的重点是前馈神经网络(feed forward network),因为模型的大部分参数都存储于此。如果问模型的容量在哪里,答案就在这里[2]。
教学大纲:预示未来多于涵盖内容
我认为本课程最有价值的部分并非第一节课,而是教学大纲页面上列出的全部九节课的主题清单[4]。
因为它直接排列了 AI 领域在 2026 年所关注的重点。
- 第 2 课:语言模型,涵盖混合专家系统(Mixture of Experts)、多头注意力(MHA)与多查询注意力(MQA)及分组查询注意力(GQA)的区别、RoPE 位置嵌入、上下文长度、温度设置以及采样策略。
- 第 3 课:模型训练,从预训练、有监督微调、LoRA、人类偏好对齐、推理能力到在线策略蒸馏(on-policy distillation)。
- 第 4 课:强化学习,涵盖奖励设计、策略梯度、PPO、GRPO 以及再次涉及的在线策略蒸馏。
- 第 5 课:LLM 系统,涵盖分布式训练、推理优化、KV 缓存、推测解码(speculative decoding)、Flash Attention 以及硬件权衡。
- 第 6 课:AI 智能体,涵盖工具调用、MCP、记忆、检索、上下文压缩、Harness 优化、编码智能体,以及技能(skills)和插件(plugins)。
- 第 7 课:LLM 评估,涵盖以 AI 为裁判、偏见与陷阱、智能体评估以及基准测试(benchmark)。
- 第 8 课:扩散语言模型(Diffusion LLM),涵盖连续扩散、离散扩散和掩码扩散。
- 第 9 课:热门话题,以多种视角收尾。
仔细研读这份清单便会发现,课程的后半部分并非仅谈论理论,而是涉及从业者日常实际遇到的问题。
我在第 6 课中看到“上下文压缩”(context compaction)和“Harness 优化”(harness optimization)这两个词,我认为它们并非学术术语,而是用户在对话越来越长时实际遇到的痛点。
在第 6 课的主题列表中,明确列出了 Context compaction 和 Harness optimization[4]。
作弊小抄已提供泰语翻译版
本课程提供一份名为“cheat sheet”的总结文档,讲师称其仅在几周前才更新,并致力于保持最新状态,以便学生在考前复习使用[2]。
有趣的是,该文档已被翻译成多种语言,讲师在视频中提到目前约有 15 种语言版本,包括英语[2]。最新版本的文档可直接从课程的 cheatsheet 页面下载[9]。
若进入课程代码仓库查看,会看到按语言代码划分的独立文件夹,其中确实存在一个标记为 th 的泰语版本文件夹,文件名为 cheatsheet-transformers-large-language-models.pdf[6][7]。
此外,本课程的教材名为《Super Study Guide: Transformers & Large Language Models》,斯坦福大学图书馆可供借阅,也可在线购买[1][8]。
若想开始学习,该如何着手?
课程本身指出,合适的学习者未必非要是研究人员。
讲师将目标受众宽泛地划分为三类:一是希望成为研究人员并需要了解实际所用技术的人;二是希望开展个人项目并需了解代码辅助工具的能力边界的人;三是从事任何需要 AI 知识职位的从业者,因为讲师认为理解这些工具正变得不可或缺[2]。
上课前应具备线性代数基础,例如了解矩阵及其乘法,以及机器学习基础,例如了解损失函数、神经网络和嵌入(embedding)[2]。
如果基础尚不牢固,讲师也表示课程中会解释 embedding 相关内容,只是若有前置基础会更容易跟上进度。
在实践中,我建议先完整观看第一节课,再配合查阅 cheat sheet,因为正如讲师自己承认的那样,第一节课概念密度最大,是最难的一课[2]。
之后,再根据兴趣选择接下来观看的章节。如果想了解为什么聊天机器人会给出奇怪的回复,请观看第 2 章;如果想知道如何提升模型性能,请观看第 3 和 4 章;如果想了解如何在小型设备上运行大型模型,请前往第 5 章。
如果对智能体(Agent)话题直接感兴趣,第 6 章是值得关注的一节。
所有内容均免费,无需注册,也无需使用信用卡,随时随地即可在家或其他地方观看。
那么你呢?
我想提出的问题是:当你使用 AI 辅助工作时,你希望对它有多深的理解?
“仅仅会使用”与“理解其内部运作机制”,这两者在遇到问题时带来的结果截然不同。
如果你看过这门课程,或者有其他有助于深入理解大语言模型的课程,欢迎分享你认为最具性价比的那一个。
参考文献
[1] Stanford University, "CME 295 - Transformers & Large Language Models", cme295.stanford.edu, 2026. https://cme295.stanford.edu/
[2] Afshine Amidi 和 Shervine Amidi, "Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers", Stanford Online (YouTube), 2026年9月28日. https://www.youtube.com/watch?v=114i2Kz-LZA
[3] Stanford University, "CME 295 Course staff", cme295.stanford.edu, 2026. https://cme295.stanford.edu/#course-staff
[4] Stanford University, "Syllabus", cme295.stanford.edu, 2026. https://cme295.stanford.edu/syllabus/
[5] Ashish Vaswani 等人, "Attention Is All You Need", arXiv, 2017. https://arxiv.org/abs/1706.03762
[6] Afshine Amidi 和 Shervine Amidi, "stanford-cme-295-transformers-large-language-models", GitHub, 2026. https://github.com/afshinea/stanford-cme-295-transformers-large-language-models
[7] Afshine Amidi 和 Shervine Amidi, "Transformer and大型语言模型内容总结,适用于斯坦福大学 CME 295 课程", GitHub (th 文件夹), 2025. https://github.com/afshinea/stanford-cme-295-transformers-large-language-models/tree/main/th
[8] Afshine Amidi 和 Shervine Amidi, "Super Study Guide: Transformers & Large Language Models", superstudy.guide, 2024. https://superstudy.guide/transformers-large-language-models/
[9] Stanford University, "Cheatsheet", cme295.stanford.edu, 2026. https://cme295.stanford.edu/cheatsheet
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。