Apr 23, 2026

LLM Từ Bên Trong - Từ Đoán Token Tới Biết Suy Luận

Primer · Engineering · LLM · Transformer · RLHF · 2020–2026
LLM · từ bên trong · cho mid-level SWE

Một mô hình đoán từ tiếp theo, ba tầng huấn luyện, và vài trò khéo lúc chạy - đó là toàn bộ câu chuyện LLM.

ChatGPT ra mắt cuối 2022 trên nền GPT-3.5. Bốn năm sau, 2026, các LLM biên giới có hơn nghìn tỉ tham số, cửa sổ ngữ cảnh cả triệu token, biết "suy nghĩ trước khi trả lời". Hạt nhân vẫn là một thứ rất đơn giản: dự đoán token kế tiếp. Bài này bóc tầng bằng hình, đủ để một software engineer mid-level hiểu cả stack - từ tokenizer, transformer, pretrain, RLHF, Constitutional AI của Claude, tới KV cache, speculative decoding, MoE, và reasoning.

Nov 2022
ChatGPT ra mắt · GPT-3.5
~15T
token pretrain (LLaMA 3+)
1M
context window tối đa 2026
0
trí nhớ giữa hai request (mặc định)

Bài này dành cho ai? Software engineer mid-level từng nghe các từ "transformer", "RLHF", "inference", "MoE" nhưng chưa ghép được chúng vào một bức tranh. Không cần nền toán sâu - chỉ cần biết matrix, probability cơ bản, và có viết code.

Bài này không phải gì? Không phải giáo trình. Không có đạo hàm, không có gradient descent từ đầu. Mục tiêu: xây mental model đủ đúng để đọc paper, viết prompt, chọn model, debug app LLM mà không nói sai kỹ thuật.

1 · Một câu tóm tắt cả LLM

LLM là một hàm số lấy vào một chuỗi token, trả ra một phân phối xác suất trên toàn bộ vốn từ của nó cho token tiếp theo. Đó là toàn bộ API ở lõi. Mọi thứ hào nhoáng - viết code, giải toán, suy luận, viết văn - đều là phần bề mặt của việc gọi đi gọi lại hàm đó, mỗi lần lấy một token mới rồi dán lại vào cuối chuỗi.

The cat sat on the mat
Next-token prediction. Mô hình chấm xác suất mọi token trong vốn từ (~50k–200k entries). mat thắng. Dán vào cuối, chạy lại. Lặp cho tới khi ra ký tự dừng hoặc hết budget.
Tại sao lại là "token" mà không phải từ? Tokenizer (thường là BPE - Byte Pair Encoding) cắt văn bản thành các mảnh phổ biến. "ChatGPT" có thể thành ["Chat", "G", "PT"]; "playing" thành ["play", "ing"]. Điều này cho phép vốn từ hữu hạn bao phủ cả tên riêng, từ hiếm, ngôn ngữ lạ - và giải thích vì sao đếm ký tự trong LLM không bao giờ khớp với ước lượng của bạn.

Một hệ quả khó chịu: LLM không biết ký tự. Nó thấy "strawberry" là chừng 2–3 token gộp. Hỏi "có mấy chữ r?" là bạn đang bắt nó đếm thứ nó chưa bao giờ thấy. Phần lớn lỗi "ngớ ngẩn" của LLM nằm ở lớp tokenizer này, không phải ở lớp suy luận.

2 · Transformer - Trái tim của mọi LLM

Mọi LLM hiện đại - GPT, Claude, LLaMA, Gemini, Mistral, DeepSeek, Qwen - đều dùng kiến trúc Transformer (Vaswani et al., Google, 2017, "Attention Is All You Need"). Phiên bản dành cho LLM sinh văn bản gọi là decoder-only transformer. Cấu trúc rất đều đặn: xếp chồng cùng một khối (block) 30–120 lần.

Token Embeddings + Positional
[B, T, d_model]
RMSNorm / LayerNorm
pre-norm
Multi-Head Self-Attention
Q · Kᵀ / √d → softmax → V
Feed-Forward / MLP (SwiGLU)
up → gate → down
↑ lặp lại 30–120 lần (n_layers) ↑
Final RMSNorm
[B, T, d_model]
LM Head (logits)
[B, T, vocab] → softmax
Decoder-only transformer. Một block = attention + FFN + hai norm + residual. Xếp chồng là tất cả. GPT-3 có 96 block, LLaMA 3 70B có 80, Claude không public.

Self-attention trong 60 giây

Với mỗi token, ba vector được sinh ra: Q (query - "tôi đang tìm gì?"), K (key - "tôi là gì?"), V (value - "tôi mang thông tin gì?"). Token hiện tại so query của nó với key của tất cả token phía trước, ra điểm khớp, rồi trộn value theo điểm đó. Kết quả: mỗi token được "viết lại" với ngữ cảnh bao quanh.

Multi-head attention. Mỗi head học một kiểu liên kết: Head 1 (tím) bắt chủ ngữ (cat), Head 2 (xanh) bắt động từ (saw), Head 3 (xanh lá) bắt từ gần kề. Nhiều head chạy song song, concat lại - đó là "multi-head".
Vocab
50k–200k
Kích thước tokenizer. Lớn hơn = cover tốt ngôn ngữ hiếm, nhưng tốn RAM.
d_model
4k–16k
Chiều vector mỗi token. Càng lớn càng "giàu" nhưng compute bùng nổ bậc 2.
n_layers
32–120
Số block xếp chồng. Sâu = học được trừu tượng đa cấp.
n_heads
32–128
Song song hoá attention. 2024+ dùng GQA/MQA để share key-value.
Vì sao "attention is all you need"? Kiến trúc cũ (RNN, LSTM) xử lý chuỗi tuần tự - token 100 phải đợi token 99. Attention nhìn cả chuỗi song song, GPU nhân ma trận được khai thác tối đa. Đó là lý do duy nhất Transformer scale lên được nghìn tỉ tham số mà RNN thì không.

3 · Timeline - Từ GPT-3 đến thế hệ 2026

Trước ChatGPT, LLM là đồ chơi học thuật. Sau ChatGPT, nó là sản phẩm. Dưới đây là các cột mốc định hình ngành, dồn nén vào chưa đầy bốn năm rưỡi.

GPT-3
2020-06
ChatGPT (3.5)
2022-11
LLaMA 1
2023-02
GPT-4
2023-03
Claude + Mistral
2023-03 / 09
o1 - reasoning era
2024-09
DeepSeek R1
2025-01
Claude 4.x · LLaMA 4
2025-26
Breakthrough · 2022-11
ChatGPT (GPT-3.5)
Không phải model mạnh nhất OpenAI có, nhưng là model được RLHF kỹ đầu tiên cho công chúng. 100M user trong 2 tháng - nhanh nhất lịch sử phần mềm. Khoảnh khắc LLM rời khỏi phòng lab.
Scale + multimodal · 2023-03
GPT-4
Nhảy vọt về khả năng: thi luật, y khoa, lập trình vượt mức chuyên gia. Lần đầu vision tích hợp. OpenAI ngừng công bố kích thước - ước chừng ~1.8T (MoE).
Open weights · 2023-02
LLaMA 1 → 4
Meta phát hành weights. LLaMA 1 rò rỉ lên 4chan → bùng nổ cộng đồng local LLM. LLaMA 3 (2024) và LLaMA 4 (2025) là frontier open - đọ được với GPT-4.
Safety-first · 2023-03
Claude
Anthropic, tách ra từ OpenAI 2021. Đi hướng khác: Constitutional AI - dùng AI để tự chỉnh AI theo bộ "hiến pháp" các nguyên tắc, thay vì chỉ dựa vào người chấm điểm.
Efficient open · 2023-09
Mistral 7B / Mixtral
Startup Pháp chứng minh model nhỏ (7B) được train tốt có thể vượt model lớn hơn. Mixtral 8×7B (MoE) mở màn trào lưu MoE trong open weights.
Reasoning · 2024-09
OpenAI o1 → o3
Lần đầu model được thưởng vì suy nghĩ lâu hơn. Sinh ra chain-of-thought dài trước khi trả lời. Đánh dấu trục scaling mới: test-time compute, không chỉ pretrain.
Open reasoning · 2025-01
DeepSeek V3 / R1
Trung Quốc phát hành weights reasoning đọ o1, chi phí train ~6M USD (theo báo cáo). Chấn động thị trường, khiến Nvidia mất 600B USD vốn hoá trong một ngày (Jan 2025).
Hiện tại · 2026
Claude 4.7 · GPT-5 · Gemini 3
Frontier hội tụ quanh: extended thinking (bật/tắt reasoning), 1M context, tool use/agent, multimodal mặc định. Khoảng cách closed-open thu hẹp còn 3–6 tháng.

4 · Cách train - Ba giai đoạn

Một model như Claude hay GPT-4 không được train một lần. Nó đi qua ba giai đoạn rất khác nhau về dữ liệu, mục tiêu và chi phí. Hiểu ba giai đoạn này là chìa khoá để hiểu vì sao LLM "cư xử" như hiện tại.

Stage 1 · 99% compute
Pretraining
Nuốt gần hết internet sạch được. Mục tiêu duy nhất: đoán token kế. Sinh ra base model - biết mọi thứ nhưng nói lung tung, không tuân lệnh.
Data: ~15T token
Compute: tháng, $10–100M
Loss: cross-entropy next-token
Stage 2 · ~0.5% compute
SFT - Supervised Fine-Tuning
Người viết hàng chục nghìn cặp prompt → câu trả lời lý tưởng. Model học format chat, cách tuân chỉ thị, cách dùng tool. Ra chat model.
Data: 10k–1M cặp
Compute: ngày
Loss: next-token, chỉ trên phần assistant
Stage 3 · ~0.5% compute
RLHF / DPO / RLAIF
Huấn luyện bằng so sánh: model viết 2 câu trả lời, ai đó (người hoặc AI) nói cái nào tốt hơn. Model học dịch chuyển phân phối về phía "tốt hơn". Ra aligned model.
Data: 100k–10M preference
Compute: ngày-tuần
Loss: reward-weighted / preference

Pretraining - Nơi mọi "kiến thức" đến từ

Pretraining là giai đoạn nuốt dữ liệu. Mọi thứ LLM "biết" về thế giới - Python syntax, lịch sử La Mã, công thức nấu phở - đều đi vào đây. Dataset pha trộn: Common Crawl (lọc kỹ), Wikipedia, sách, GitHub code, arXiv, Stack Exchange, bài blog. Qualtiy filter là phần bí mật nhất - data kém là model kém.

GPT-3 175B params · 2020
0.3T tokens
Chinchilla 70B · 2022
1.4T tokens
LLaMA 2 70B · 2023
2.0T tokens
LLaMA 3 70B · 2024
15T tokens
LLaMA 4 / frontier 2025-26
20T+ ước tính
Chinchilla scaling law (DeepMind, 2022) chỉ ra GPT-3 bị undertrain - với cùng compute, model nhỏ hơn + nhiều data hơn sẽ tốt hơn. Quy tắc ngón tay: mỗi param nên ăn ~20 token. Thế hệ 2024+ đi xa hơn: LLaMA 3 ăn ~200 token/param vì "over-training" làm inference rẻ hơn - model nhỏ chạy nhanh hơn, dù train đắt hơn.

Sau pretraining, bạn có base model. Nó biết viết code Python, biết ngữ pháp tiếng Việt, biết Trần Hưng Đạo là ai - nhưng nếu bạn hỏi "Xin chào, bạn làm gì đấy?" nó sẽ trả lời kiểu: "Tôi đang viết bài. Bạn thì sao? - Tôi đang rảnh rỗi. - Hay quá, tôi cũng thế..." Nó chỉ nối tiếp văn bản, không biết "trả lời" là gì. Đó là việc của hai giai đoạn sau.

SFT - Dạy model biết "trả lời"

SFT = Supervised Fine-Tuning. Bản chất giống pretraining (next-token prediction) nhưng data là hàng chục đến hàng trăm nghìn cặp user question → assistant answer viết thủ công hoặc chọn lọc. Model học format chat, học thái độ trợ lý, học dừng đúng chỗ.

Dữ liệu SFT định hình "tính cách" ban đầu của model. Nếu mọi câu trả lời đều dài, lịch sự, có bullet points - model học theo. Đây là lý do bạn thấy tất cả chatbot đều có giọng điệu hơi giống nhau: cùng pool contractors chấm điểm, cùng style guide.

RLHF - Dạy model biết "trả lời cho tốt hơn"

SFT dạy "một câu trả lời đúng". RLHF (Reinforcement Learning from Human Feedback) dạy mức độ tốt. Công thức kinh điển do OpenAI phổ biến 2022 (InstructGPT, nền móng của ChatGPT):

  1. Sinh: model trả lời cùng một prompt 2-4 lần.
  2. Chấm: người annotator xếp hạng các câu trả lời.
  3. Reward model: train một model nhỏ dự đoán điểm người chấm.
  4. RL: dùng reward model làm "giáo viên", PPO tối ưu policy (LLM) để tăng điểm kỳ vọng, có penalty KL để không trôi quá xa base.

RLHF là thứ biến GPT-3 thành ChatGPT. Cùng model nền, trước RLHF nó hữu dụng khoảng 30% thời gian; sau RLHF, 80%+. Các kỹ thuật thay thế đã xuất hiện:

DPO · 2023
Direct Preference
Bỏ reward model riêng, optimize trực tiếp từ cặp preference. Đơn giản hoá pipeline, ổn định hơn PPO. Hầu hết open-source 2024+ dùng DPO/variants.
RLAIF · 2022+
AI Feedback
Thay người chấm bằng một LLM khác. Rẻ hơn, nhanh hơn, scale được. Anthropic tiên phong trong Constitutional AI.
RLVR · 2024+
Verifiable Rewards
Với toán/code - check tự động đáp án đúng sai. Không cần chấm. Là cốt lõi của DeepSeek R1 và các reasoning model.

5 · Constitutional AI - Con đường Claude

Anthropic được lập 2021 bởi nhóm cựu OpenAI, trong đó có Dario & Daniela Amodei và các tác giả chính của paper GPT-3, với luận điểm: RLHF có bottleneck là con người - không scale, không nhất quán, không minh bạch về giá trị. Giải pháp đề xuất: Constitutional AI (CAI), paper 2022.

OpenAI / mặc định ngành · 2022
RLHF
1
Model sinh cặp câu trả lời cho cùng prompt.
2
Người annotator chọn câu tốt hơn.
3
Train reward model mô phỏng sở thích con người.
4
PPO đẩy LLM về hướng reward cao.
Điểm yếu: giá trị ẩn trong đầu người chấm, khó audit. Khó scale (tốn người). Không nhất quán giữa các rater.
Anthropic / Claude · 2022+
Constitutional AI (CAI)
1
Viết "hiến pháp" - danh sách nguyên tắc bằng tiếng Anh (ví dụ: "Chọn câu trả lời ít nguy hại nhất").
2
Model trả lời prompt, rồi tự phê bình và viết lại theo hiến pháp.
3
Một AI khác so sánh cặp phản hồi, chọn cái tuân hiến pháp hơn.
4
Dùng preference đó train RLAIF - giống RLHF nhưng feedback từ AI.
Ưu điểm: giá trị hiển ngôn trong hiến pháp (có thể audit, tranh luận). Scale được. Nhất quán. Giảm dependency vào lao động chấm điểm.

Hiến pháp của Claude công khai một phần - trích từ Tuyên ngôn Nhân quyền LHQ, điều khoản dịch vụ của Apple, các nguyên tắc nghiên cứu AI. Điều này không có nghĩa Claude "đọc hiến pháp" mỗi lần trả lời - các nguyên tắc được bake vào weights thông qua giai đoạn RL.

Character training - Một lớp nữa của Claude

Anthropic công khai thêm một bước gọi là character training (từ ~Claude 3, 2024): dùng technique tương tự CAI để định hình tính cách (trái với chỉ "an toàn"). Claude được dạy các đặc tính như tò mò, thẳng thắn lúc cần, khiêm tốn về giới hạn của chính mình, không giả vờ đồng ý. Đây là lý do Claude thường được nhận xét có "giọng" riêng biệt so với GPT hay Gemini.

Góc kỹ sư: Khi bạn dùng API, system prompt của bạn nằm phía trên character đã bake vào model. Bạn không thể "unbake" character bằng prompt - bạn chỉ có thể nhấn mạnh/điều chỉnh biên. Đây là lý do cùng một prompt, Claude và GPT-4 trả lời với "nhịp" khác nhau.

6 · Inference - Tối ưu lúc chạy

Train một lần, chạy hàng tỷ lần. Inference là nơi hoá đơn cloud của bạn phát sinh, và là nơi kỹ sư ML đổ công nhất trong 2023-2026. Các kỹ thuật dưới đây xếp chồng được - một request của Claude qua API thường được hưởng gần như toàn bộ.

KV cache - Trò khéo đơn giản nhất, ảnh hưởng lớn nhất

Khi sinh token thứ 100, attention cần KV của 99 token trước. Nếu tính lại từ đầu mỗi token, chi phí O(n²). KV cache chỉ đơn giản là lưu lại K, V đã tính một lần. Từ token thứ 2 trở đi, chỉ tính K, V mới. O(n²) → O(n).

Token 1
k₁v₁
-
-
-
-
-
-
-
Token 2
k₁v₁
k₂v₂
-
-
-
-
-
-
Token 5
k₁v₁
k₂v₂
k₃v₃
k₄v₄
k₅v₅
-
-
-
Token 8
k₁v₁
k₂v₂
k₃v₃
k₄v₄
k₅v₅
k₆v₆
k₇v₇
k₈v₈
Prompt caching mà Anthropic và OpenAI bán gần đây chính là việc giữ KV cache giữa các request có prefix giống nhau. System prompt dài? Trả ~10% giá cho lần đầu, ~1% cho các lần sau. Chiến lược: đặt phần bất biến lên đầu prompt.

Speculative decoding - Một draft + một verify

Model lớn chạy chậm (mỗi token là một pass qua toàn bộ weights). Ý tưởng: dùng draft model nhỏ, nhanh, đoán trước k token. Rồi model lớn kiểm tra cả k token trong một pass. Những token nào draft đoán đúng được chấp nhận. Token đầu tiên sai bị sửa. Kết quả: nếu draft đoán tốt 70% thời gian, tốc độ tăng ~2-3 lần không mất chất lượng (về mặt toán học, output phân phối giống hệt).

Draft (nhỏ)
The
quick
brown
fox
jumps
Target (to)
The
quick
brown
fox
dog
Output
The
quick
brown
dog

Bốn token sinh ra trong một forward pass của target model thay vì bốn pass riêng lẻ.

MoE - Chia chuyên gia

Mixture of Experts: thay vì 70B tham số đều được kích hoạt cho mọi token, có ví dụ 400B tham số chia thành N "expert" (thường là N=8, 32, hoặc 256). Mỗi token, một router nhỏ chọn top-k expert (thường k=1-2). Chỉ k/N weights được tính. Kết quả: capacity lớn (nhiều param = nhiều knowledge), compute nhỏ (chỉ active một phần).

Token
"Python"
ROUTER - chọn top-2/8
E1
E2
E3
E4
E5
E6
E7
E8
Output
h(t)
Mixtral 8×7B: ~47B tổng, chỉ ~13B active. DeepSeek V3: 671B tổng, 37B active. Capacity của 671B, giá inference của 37B - lý do MoE thống trị 2024-2026.

Quantization - Giảm bit, giữ chất lượng

Weights thường train ở FP16/BF16 (16-bit). Sau train, có thể ép về INT8, INT4, thậm chí FP4 với mất mát rất nhỏ. LLaMA 3 70B ở FP16 cần 140GB; ở INT4 chỉ 40GB - chạy được trên một GPU consumer. Đây là lý do bạn chạy được LLaMA trên MacBook M-series.

Test-time compute - Trả lời lâu để trả lời đúng

Trục scaling thứ hai xuất hiện cuối 2024 với OpenAI o1: thay vì làm model lớn hơn, cho model sinh nhiều token hơn trước khi trả lời cuối. Tokens suy luận (thinking/reasoning tokens) được thưởng nếu dẫn đến đáp án đúng (qua RLVR với toán/code). Nhiều compute lúc chạy → câu trả lời tốt hơn. Kinh tế AI đảo chiều: bây giờ bạn có thể trả thêm tiền mỗi câu trả lời để được thông minh hơn.

User prompt
If 8 people shake hands with each other exactly once, how many handshakes occur?
Hidden reasoning (model thinks - thường không trả về user)
Each handshake involves 2 people. Total pairs = C(8,2) = 8!/(2!·6!) = 28. Let me double-check: person 1 shakes with 7 others, person 2 with 6 remaining... 7+6+5+4+3+2+1 = 28. Matches.
Final answer (user sees)
28 handshakes.

Claude có "extended thinking" từ Claude 3.7 (2025): bạn bật flag, model sinh đến hàng chục nghìn token suy luận ẩn, rồi trả câu cuối ngắn gọn. Với bug khó trong code, khoảng cách "suy luận tắt" vs "suy luận bật" đôi khi là vài chục phần trăm accuracy.

7 · Open source - Sân chơi mới

Đến 2026, open weights không còn là đồ chơi. DeepSeek R1, LLaMA 4, Qwen 3, Mistral Large - tất cả cạnh tranh ngang ngửa với frontier đóng trong nhiều benchmark. "Open weights" không có nghĩa open-source đúng nghĩa (code + data + pipeline). Phần lớn chỉ công bố weights; data và quy trình train vẫn đóng. Nhưng đủ cho bạn: chạy local, fine-tune, audit hành vi ở mức input-output.

Model Params (tổng / active) Context Loại Ghi chú
Claude Opus 4.7 Anthropic · 2026 - / - 1M Closed Frontier reasoning + character. Không công khai kiến trúc.
GPT-5 OpenAI · 2025 - / - 400k+ Closed Reasoning Hợp nhất GPT + o-series. Router tự chọn mức think.
Gemini 3 Pro Google · 2025 - / - 2M Closed MoE Context dài nhất. Native multimodal.
LLaMA 4 Behemoth Meta · 2025 ~2T / ~288B 10M (subset) Open MoE Model mở lớn nhất. Teacher cho các LLaMA 4 nhỏ hơn.
DeepSeek V3 / R1 DeepSeek · 2024-25 671B / 37B 128k Open MoE Reasoning Train chi phí thấp (~$6M báo cáo). Reasoning open-source đầu tiên đọ được o1.
Qwen 3 / QwQ Alibaba · 2025 235B / 22B 256k Open MoE Reasoning Mạnh tiếng Trung, đa ngôn ngữ Á. Nhiều size từ 0.5B đến 235B.
Mistral Large 2 Mistral · 2024 123B / 123B 128k Open-ish Dense (không MoE). License thương mại hạn chế.
Gemma 3 Google · 2025 27B / 27B 128k Open Chạy tốt trên một GPU consumer. Multimodal.
Gap đóng-mở 2026: 3-6 tháng trên benchmark chung; 6-12 tháng trên reasoning khó. Điểm open thắng: chi phí, privacy, tuỳ biến (fine-tune, LoRA). Điểm closed thắng: tool use/agent polish, reasoning depth, latency ổn định qua tải lớn. Với app đang prototype, dùng API closed; với app scale/compliance, migrate dần sang open hosted (Fireworks, Together, Groq) hoặc self-host.

Open Source LLM có thực sự "Open Source"?

Hầu hết cái gọi là "open-source LLM" trong media kỳ thực là open weights - weights được công khai để tải về, chạy, fine-tune. Nhưng data, code train, hyperparams, log - những thứ bạn cần để dựng lại model từ đầu - gần như luôn đóng. Năm 2024, OSI (Open Source Initiative) công bố định nghĩa chính thức Open Source AI yêu cầu cả bốn: weights, code, data (hoặc chi tiết đủ để tái tạo), và license cho phép sửa đổi + phân phối.

Theo tiêu chuẩn đó, phần lớn LLM "mở" hiện nay không đạt. Dưới đây là phổ bốn mức độ, từ đóng kín đến open source theo OSI:

Mức 1 · Closed
API-only
GPT-5, Claude 4.7, Gemini 3
  • Weights
  • ~ Kiến trúc (hint)
  • Training data
  • Training code
  • ~ Model card / safety report
  • License mở
Mức 2 · Open weights, license hạn chế
"Community"
LLaMA 3/4, Gemma 3
  • Weights (tải được)
  • Kiến trúc + paper
  • Training data
  • Training code
  • ~ Recipe ở mức cao
  • ~ License: chặn >700M MAU, chặn train model khác bằng output, acceptable-use policy
Mức 3 · Open weights, license thương mại
"Permissive weights"
Mistral (Apache 2.0), Qwen 3 (Apache 2.0), DeepSeek (MIT-ish)
  • Weights
  • Kiến trúc + paper
  • Training data
  • ~ Inference code (ref impl)
  • ~ Training recipe một phần
  • License: Apache 2.0 / MIT - dùng thương mại tự do
Mức 4 · Open source đúng nghĩa (OSI)
Fully reproducible
OLMo 2 (AI2), Pythia (EleutherAI), Amber/LLM360
  • Weights + checkpoints
  • Kiến trúc + paper
  • Training data công khai (Dolma, Pile)
  • Training code + configs
  • Log, loss curve, seeds
  • License Apache 2.0
Hai điều đáng nghi trong "open": (1) Meta LLaMA license cấm dùng output LLaMA để train model khác - trái với tinh thần open-source. (2) Dữ liệu train gần như không ai công bố, phần vì sợ kiện bản quyền (NYT kiện OpenAI, Getty kiện Stability), phần vì data là lợi thế cạnh tranh. Không có data, bạn không audit được bias, không phát hiện được leak test set, không tái tạo được model.
Ai đang đi đúng nghĩa open source? Phần lớn là phi-lợi-nhuận hoặc học thuật: Allen Institute (AI2) với OLMo 2 - 13B/32B params, data Dolma công khai, config + log đầy đủ; EleutherAI với Pythia - hạ tầng cho nghiên cứu interpretability; LLM360 với Amber/Crystal. Ba nhóm này chiếm vài % thị phần nhưng đặt ra tiêu chuẩn cho phần còn lại.

Với engineer: đừng bị marketing "open source" đánh lừa khi đánh giá pháp lý hay tái tạo. Hỏi thẳng: có weights không? license gì? dữ liệu train ở đâu? train lại được không? Bốn câu đó tách được LLM bạn có thể thực sự làm chủ khỏi LLM chỉ được "cho mượn".

8 · Mental model cho engineer

Nếu phải giữ lại năm điều thôi để viết app LLM cho đúng, đây là năm điều:

1
LLM không có state
Mỗi request, bạn gửi toàn bộ lịch sử. "Memory" là illusion do client tái tạo. Prompt là state machine duy nhất.
2
Token, không phải chữ
Pricing theo token. Context theo token. Khi LLM "sai chính tả", 90% do tokenizer chia lạ. Đừng bắt nó đếm ký tự.
3
Temperature là random, không phải "sáng tạo"
temperature=0 không tất định (phụ thuộc batch, hardware). Muốn reproducibility chặt, dùng seed + cẩn thận với prompt caching.
4
Suy luận ẩn ≠ câu trả lời
Model reasoning có hidden tokens đắt hơn input/output bình thường. Budget cẩn thận. Cho task dễ thì tắt thinking.
5
Evals > benchmark > vibe check
Trước khi đổi model hay prompt, có eval đo kết quả thực. Một câu demo đẹp không nói gì về tỉ lệ hỏng 0.1%.
6
Prompt caching miễn phí performance
Đặt phần bất biến (system, few-shot, RAG context ổn định) lên đầu. Phần thay đổi (user input) xuống cuối. Bill giảm 90%.
Tóm lại. Một LLM là Transformer decoder xếp chồng, train ba tầng (pretrain → SFT → RL), phục vụ bằng KV cache + (tuỳ nhà) speculative decoding + MoE + quantization + optional reasoning. ChatGPT không phát minh LLM; nó phát minh một LLM đủ dễ dùng cho người thường. Bốn năm sau, các model biên giới đã gấp 100 lần về capability, nhưng công thức vẫn là bốn mảnh: kiến trúc, data, RL, inference engineering. Tất cả phần còn lại - agent, tool use, multimodal, MCP, 1M context - là biến tấu trên bốn mảnh này. Nắm chúng, bạn đọc được mọi paper và changelog của 2026.

Read next

More from the shelf

Apr 26, 2026Rào Cản Tri Thức Sụp Hai Lần: Internet 1995, AI 2023, Ai Bắt Sóng, Ai Bị Bỏ LạiApr 23, 2026GPU, HBM, và Memory Wall - Nút Thắt Cổ Chai Thật Sự Của AIJul 23, 2026Attention Economy: Cuộc Đấu Giá Nghìn Tỷ Đô Cho Từng Giây Chú ÝJun 5, 2026Prediction Market: Khi Tương Lai Được Định Giá Bằng Vốn

Pass it on

If it found you, share it kindly

XEmail

03 Discussion

Leave a note

A considered space for questions, counterpoints, and useful additions. Civil, on-topic, signed.

Reader notes

...

Loading notes...