รีวิวหนังสือ Pre-Training LLM Engineering: เจาะลึก Distributed Training สถาปัตยกรรมโมเดล และ Scaling Laws
เวลาพูดถึง LLM คนมักนึกถึงการ Fine-tune หรือการเขียน Prompt แต่ความรู้แทบทั้งหมดของโมเดลภาษาขนาดใหญ่ถูกสร้างขึ้นก่อนหน้านั้นในขั้นตอน Pre-training ซึ่งต้องใช้ GPU หลายร้อยถึงหลายพันตัว ข้อมูลหลายล้านล้านโทเคน และการตัดสินใจทางวิศวกรรมจำนวนมากที่พลาดไม่ได้เพราะต้นทุนสูงมาก หนังสือ Pre-Training LLM Engineering: Distributed Training, Architecture Design, and Scaling Laws โดย ChatVariety Team พาไปที่รากฐานนั้นโดยตรง ผ่าน 3 คำถามที่ทุกทีมต้องตอบ: จะกระจายงานบนฮาร์ดแวร์อย่างไร โมเดลควรมีหน้าตาแบบไหน และควรใหญ่แค่ไหนเมื่อเทียบกับงบประมาณการคำนวณที่มี
เล่มนี้อยู่ในซีรีส์ Production AI Engineering ซึ่งเป็นชุดหนังสืออ้างอิงเชิงปฏิบัติสำหรับวิศวกรที่สร้างและดูแลระบบ AI จริง หมายเหตุ: ตัวหนังสือเขียนเป็นภาษาอังกฤษ

หนังสือเล่มนี้ว่าด้วยเรื่องอะไร
ชื่อรองของหนังสือระบุ 3 ศาสตร์ที่ร่วมกันกำหนดว่าการเทรนโมเดลจะสำเร็จหรือไม่ และจะใช้เงินมากแค่ไหน
Distributed Training: LLM ยุคใหม่ไม่มีทางใส่ลงใน GPU ตัวเดียวได้ จึงต้องแบ่งงาน เช่น Data Parallelism ที่คัดลอกโมเดลแล้วแบ่งข้อมูล, ZeRO และ FSDP ที่กระจายพารามิเตอร์และ Optimizer State เพื่อลดหน่วยความจำ, Tensor Parallelism ที่แบ่งเลเยอร์ย่อย และ Pipeline Parallelism ที่วางกลุ่มเลเยอร์ไว้คนละอุปกรณ์ งานจริงใช้ผสมกันพร้อม Mixed Precision แบบ BF16, Activation Checkpointing และการบันทึก Checkpoint ที่ทนต่อความเสียหาย เพราะในระดับนี้ฮาร์ดแวร์เสียเป็นเรื่องปกติ
การออกแบบสถาปัตยกรรม: โมเดลชั้นนำส่วนใหญ่เป็น Transformer แบบ Decoder-only แต่รายละเอียดสำคัญมาก เช่น Pre-normalization กับ RMSNorm, Rotary Position Embedding, SwiGLU, Grouped-Query Attention, ขนาดคำศัพท์ และสัดส่วนความลึกต่อความกว้าง ล้วนส่งผลต่อความเสถียรในการเทรน คุณภาพ และต้นทุนตอนใช้งานจริง
Scaling Laws: งานวิจัยของ OpenAI ปี 2020 และงาน Chinchilla ของ DeepMind ปี 2022 แสดงว่า Loss ลดลงอย่างคาดการณ์ได้เมื่อเพิ่มพารามิเตอร์ ข้อมูล และการคำนวณ กฎคร่าว ๆ ที่นิยมอ้างถึงคือประมาณ 20 โทเคนต่อ 1 พารามิเตอร์สำหรับการเทรนที่คุ้มค่าที่สุด และการคำนวณราว 6 × พารามิเตอร์ × โทเคน FLOPs ทำให้ประเมินงบก่อนใช้ GPU จริงได้
เมื่อรวมกัน 3 หัวข้อนี้คือห่วงโซ่การวางแผนของ Foundation Model: Scaling Laws บอกขนาดและจำนวนโทเคนเป้าหมาย สถาปัตยกรรมกำหนดสิ่งที่จะเทรน และวิศวกรรม Distributed Training ทำให้เทรนได้จริงบนคลัสเตอร์ที่มีอยู่
จุดเด่นของเล่มนี้
หนังสือ LLM ส่วนใหญ่เริ่มหลังจากส่วนที่ยากที่สุดจบไปแล้ว คือสอนการ Prompt, Fine-tune หรือ Deploy โมเดลที่คนอื่นเทรนไว้ ความรู้เรื่อง Pre-training มักกระจายอยู่ในงานวิจัย เอกสารของเฟรมเวิร์ก และบล็อกของแล็บใหญ่ หนังสือที่เจาะเรื่อง Pre-training โดยเฉพาะ และจัดเนื้อหารอบ Parallelism สถาปัตยกรรม และ Scaling จึงช่วยให้เห็นภาพรวมได้ชัดในที่เดียว
ประโยชน์ไม่ได้จำกัดแค่ทีมที่เทรนโมเดลระดับ Frontier การเข้าใจว่าทำไมโมเดลถึงมีสถาปัตยกรรมแบบนั้น และเทรนด้วยข้อมูลมากแค่ไหนเทียบกับขนาด ช่วยให้เลือก Open-weight Model ได้ดีขึ้น ประเมินต้นทุนการเทรนต่อด้วยข้อมูลเฉพาะทาง และคุยกับทีม Infrastructure ได้อย่างมั่นใจ
ราคาก็เข้าถึงง่าย: Kindle US$2.99 หรือปกอ่อน US$9.99 ณ เวลาที่เขียนบทความ ถูกกว่าค่าเช่า GPU คลัสเตอร์เพียงชั่วโมงเดียวเสียอีก
ใครควรอ่าน
วิศวกร ML ที่กำลังขยับจากงาน Fine-tune และ Inference ไปสู่การเทรน Foundation Model
วิศวกร Infrastructure และ MLOps ที่ดูแลคลัสเตอร์ GPU
นักวิจัยและนักศึกษาปริญญาโท-เอกที่วางแผนทดลอง Pre-training โมเดลขนาดเล็กถึงกลาง
Tech Lead และ CTO ที่ต้องตัดสินใจว่าจะเทรนเอง เทรนต่อ หรือใช้ Open-weight Model
นักพัฒนาซอฟต์แวร์ที่อยากเข้าใจว่า LLM ถูกสร้างขึ้นอย่างไรจริง ๆ นอกเหนือจากการเรียก API
เลือก Kindle หรือปกอ่อนดี?
Kindle (US$2.99 ณ เวลาที่เขียน): ได้อ่านทันที ค้นหาคำอย่าง FSDP, Pipeline Bubble หรือ Chinchilla ได้รวดเร็ว เปิดคู่กับไฟล์คอนฟิกการเทรนได้สะดวก
ปกอ่อน (US$9.99 ณ เวลาที่เขียน): เหมาะเป็นคู่มือบนโต๊ะ จดงบการคำนวณและเลย์เอาต์ Parallelism ของทีมลงไปได้ และส่งต่อกันในทีมระหว่างวางแผน
เล่มอื่นในซีรีส์ Production AI Engineering
Mixture of Experts Architecture Engineering – ออกแบบ เทรน และให้บริการโมเดลแบบ Sparse MoE ก้าวต่อไปหลังเข้าใจการเทรนโมเดลแบบ Dense
Fine-Tuning and Alignment Engineering – LoRA, DPO, RLHF และ Domain Adaptation สิ่งที่เกิดกับ Base Model หลัง Pre-training
AI Safety Engineering – Red Teaming เทคนิค Alignment และการปฏิบัติตามกฎระเบียบสำหรับระบบ AI จริง
คำถามที่พบบ่อย
ต้องมีคลัสเตอร์ GPU ขนาดใหญ่ถึงจะได้ประโยชน์จากหนังสือเล่มนี้ไหม?
ไม่จำเป็น หลักการเรื่อง Parallelism สถาปัตยกรรม และ Scaling ใช้ได้ทั้งการเทรนโมเดลเล็กบน GPU ไม่กี่ตัวและการวางแผนเทรนขนาดใหญ่บนคลาวด์ ยังช่วยในการประเมิน Open-weight Model และต้นทุนการเทรนต่ออีกด้วย
ควรมีพื้นฐานอะไรมาก่อน? หนังสือเป็นภาษาอะไร?
เป็นหนังสือวิศวกรรมเชิงเทคนิคที่เขียนเป็นภาษาอังกฤษ ควรเข้าใจพื้นฐาน Deep Learning, โมเดล Transformer และเฟรมเวิร์กอย่าง PyTorch ประสบการณ์กับ GPU หรือระบบกระจายช่วยได้ แต่ไม่จำเป็น
มีทั้งฉบับ Kindle และปกอ่อนหรือไม่?
มีครับ ณ เวลาที่เขียนบทความ วางจำหน่ายบน Amazon ทั้ง Kindle ราคา US$2.99 และปกอ่อนราคา US$9.99
สรุปส่งท้าย
ทุกความสามารถของโมเดลภาษาขนาดใหญ่ย้อนกลับไปที่การตัดสินใจในช่วง Pre-training หนังสือ Pre-Training LLM Engineering รวม 3 เรื่องที่สำคัญที่สุด คือ Distributed Training การออกแบบสถาปัตยกรรม และ Scaling Laws ไว้ในเล่มเดียวที่กระชับและราคาย่อมเยา ถ้าคุณอยากก้าวจากการใช้ LLM ไปสู่การเข้าใจว่ามันถูกสร้างอย่างไร หรือกำลังจะวางงบการเทรนของตัวเอง เล่มนี้ควรอยู่ในลิสต์ของคุณ
ดูหนังสือทั้งหมดของ ChatVariety Team บน Amazon



































ความคิดเห็น