TungDaDev's Blog

reasoning models & test-time compute

Reasoning models rl.jpg
Published on
/9 mins read/

Một mô hình trả lời ngay lập tức trong 200 mili-giây giống như một phản xạ vô điều kiện. Một mô hình biết dừng lại suy nghĩ, tự vấn, thử nghiệm và tự sửa sai trong 20 giây mới là sự khởi đầu của tư duy thực sự.

Đầu năm 2025, thế giới công nghệ chứng kiến một "cơn địa chấn" chưa từng có: Sự xuất hiện của DeepSeek-R1.

Chỉ trong một tuần, giá cổ phiếu của các ông lớn bán dẫn và Big Tech phương Tây bốc hơi hàng trăm tỷ USD. Tại sao một mô hình nguồn mở từ một công ty khởi nghiệp Trung Quốc lại tạo ra sự chấn động lớn đến vậy, ngay cả khi OpenAI đã ra mắt mô hình lý luận o1 trước đó vài tháng?

Câu trả lời không nằm ở sự phô trương tiếp thị, mà nằm ở một bước ngoặt mang tính cách mạng trong kiến trúc Khoa học Máy tính:

  1. Chứng minh rằng Định luật mở rộng (Scaling Law) không còn bị giới hạn bởi việc đốt hàng chục tỷ USD để mua GPU gom toàn bộ dữ liệu internet trong giai đoạn Pre-training.
  2. Mở ra kỷ nguyên mới mang tên: Test-Time Compute Scaling (Mở rộng năng lực tính toán tại thời điểm suy luận).
  3. Chứng minh rằng mô hình có thể tự học cách tư duy logic sâu sắc bằng Học tăng cường thuần khiết (Pure Reinforcement Learning) mà không cần hàng triệu ví dụ mớm sẵn từ con người!

Bài viết này sẽ mổ xẻ bản chất kỹ thuật bên dưới nắp capô của các mô hình lý luận (Reasoning Models), so sánh DeepSeek-R1 và OpenAI o1, và giải thích tại sao bước chuyển mình này sẽ tái định hình toàn bộ cách chúng ta thiết kế phần mềm.


# hai kỷ nguyên scaling laws: từ pre-training sang test-time compute

Suốt 5 năm qua, công thức thành công duy nhất của các mô hình ngôn ngữ lớn (từ GPT-2 đến GPT-4) là Pre-training Scaling Law:

\text{Loss} \propto \left(\frac{1}{N}\right)^\alpha + \left(\frac{1}{D}\right)^\beta + \left(\frac{1}{C}\right)^\gamma

Trong đó N là số tham số mô hình, D là lượng dữ liệu huấn luyện, và C là năng lực tính toán GPU. Muốn model thông minh hơn? Nhân đôi số GPU, nạp gấp 5 lần dữ liệu và train suốt 6 tháng. Nhưng đến năm 2024, con đường này chạm phải hai bức tường vật lý:

  • Cạn kiệt dữ liệu văn bản chất lượng cao của nhân loại: Hầu như toàn bộ sách báo, Wikipedia, Reddit, GitHub công khai đều đã bị LLM "nuốt trọn".
  • Chi phí năng lượng và chip GPU đạt ngưỡng trần: Một cụm siêu máy tính ngốn hàng trăm triệu USD tiền điện.

Reasoning Models đã mở ra chiều không gian thứ hai: Mở rộng năng lực tính toán tại thời điểm suy luận (Inference Scaling).

Khi bạn đưa cho một mô hình truyền thống một bài toán logic hóc búa, nó lập tức xuất token đầu tiên trong 0.2 giây dựa trên sự tương đồng phân phối từ vựng trong quá khứ \to kết quả rất dễ bị bẫy và sai sót.

Nhưng với Reasoning Model, hệ thống được cấp phát một "Ngân sách thời gian suy nghĩ" (Thinking Budget). Nó tự sinh ra hàng trăm, hàng ngàn token suy nghĩ nội tại (Internal Chain-of-Thought) trong thẻ <think> ... </think>: thử một hướng giải \to thấy bế tắc \to tự gạch bỏ \to quay lại thử hướng khác \to đến khi chắc chắn 100% mới xuất câu trả lời cuối cùng cho người dùng!


# khoảnh khắc "aha moment" và sức mạnh của pure rl

Một trong những đóng góp mang tính lịch sử nhất của báo cáo kỹ thuật DeepSeek-R1-Zero là khám phá về Học tăng cường thuần khiết mà không cần con người hướng dẫn (Zero-supervised RL).

Trước đây, người ta tin rằng muốn dạy AI suy nghĩ, con người phải viết mẫu hàng ngàn bài giải mẫu từng bước (Supervised Fine-Tuning - SFT) để máy bắt chước.

Nhóm nghiên cứu DeepSeek đã thử nghiệm một cách tiếp cận cực đoan:

  1. Lấy mô hình nền (Base Model) chưa hề được dạy cách suy nghĩ từng bước.
  2. Không cho nó bất kỳ một bài giải mẫu nào của con người.
  3. Chỉ thiết lập một cơ chế chấm điểm duy nhất dựa trên luật toán học/lập trình (Rule-based Reward): Nếu kết quả cuối cùng đúng hoặc vượt qua bộ unit test \to thưởng điểm (+1). Nếu sai hoặc format vớ vẩn \to phạt điểm (-1).
  4. Sử dụng thuật toán tối ưu hóa chính sách GRPO (Group Relative Policy Optimization).

Kết quả thật kinh ngạc: Sau hàng triệu ván cờ tự chơi với chính mình, mô hình tự phát minh ra hành vi suy nghĩ của con người!

Đoạn trích thực tế từ log suy nghĩ của DeepSeek-R1-Zero:
...
"Wait, let me double check this equation...
If x = 2, then 2^2 + 3*2 = 10, not 12.
Aha! That's where the error is!
Let me restart the derivation from step 3..."

Hiện tượng này được các nhà khoa học gọi là "Aha Moment": Mô hình tự nhiên học được cách nghi ngờ bản thân, tự kiểm tra lại các bước trước đó và đổi hướng suy nghĩ mà không cần bất kỳ một lập trình viên nào dạy nó câu lệnh "hãy suy nghĩ lại"!


# giải phẫu kiến trúc tối ưu: moe và mla

Để đạt được hiệu năng ngang ngửa OpenAI o1 nhưng chi phí tính toán chỉ bằng một phần nhỏ, DeepSeek đã kết hợp hai kỹ thuật kiến trúc đỉnh cao:

1. Kiến trúc hỗn hợp chuyên gia (Mixture-of-Experts - MoE)

Tổng số tham số của DeepSeek-R1 lên tới 671 tỷ tham số (671B), nhưng với mỗi token được sinh ra, nó chỉ kích hoạt 37 tỷ tham số (37B) thông qua các mạng phân luồng thông minh (Dynamic Router). Bạn có được trí tuệ của một siêu mô hình khổng lồ, nhưng tốc độ tính toán và chi phí lại nhẹ nhàng như một mô hình cỡ trung.

2. Multi-Head Latent Attention (MLA)

Nếu như Multi-Head Attention truyền thống làm VRAM phát nổ vì lưu trữ KV Cache khổng lồ, thì MLA nén toàn bộ thông tin Key và Value vào một không gian tiềm ẩn (Latent Vector) siêu nhỏ trước khi lưu vào bộ nhớ. Kết quả: Dung lượng KV Cache giảm tới 93.3% so với các kiến trúc cũ!


# bài học thức tỉnh cho các kỹ sư phần mềm

Sự xuất hiện của các mô hình lý luận (Reasoning Models) thay đổi hoàn toàn cách chúng ta ứng dụng AI vào hệ thống:

1. Cái chết của những kỹ thuật Prompt Engineering dài dòng

Trước đây, để mô hình giải toán hay code đúng, các kỹ sư phải viết những prompt dài cả trang: "Hãy suy nghĩ từng bước một", "Hãy đóng vai chuyên gia và làm theo 5 giai đoạn...". Giờ đây, với Reasoning Models, bạn chỉ cần đưa ra yêu cầu thuần túy và điều kiện nghiệm đúng. Bộ máy suy luận tự tìm ra con đường tối ưu mà không cần bạn phải mớm từng bước (micro-management).

2. Kỷ nguyên của "Knowledge Distillation" (Chưng cất tri thức)

Điều vĩ đại nhất mà DeepSeek mang lại cho cộng đồng chính là việc họ dùng dữ liệu suy nghĩ của mô hình 671B để chưng cất (distill) vào các mô hình nhỏ: 1.5B, 7B, 14B, và 32B.

  • Giờ đây, một mô hình nhỏ 7B chạy mượt mà trên một chiếc laptop MacBook Pro hoặc card đồ họa gaming RTX 4090 có thể giải toán và viết code tốt hơn cả GPT-4 đời đầu!
  • Các doanh nghiệp có thể đưa trí tuệ suy luận đỉnh cao này vào các thiết bị biên (Edge Devices), ứng dụng nội bộ mà không tốn một xu tiền bản quyền API.

# tổng kết

DeepSeek-R1 và OpenAI o1 không đơn thuần là những mô hình AI mới ra mắt; chúng đánh dấu khoảnh khắc chuyển dịch vĩ đại của Khoa học Máy tính: từ việc mô phỏng bề mặt ngôn ngữ sang việc thực sự mô phỏng quá trình tư duy logic và giải quyết vấn đề.

Đối với các kỹ sư phần mềm, đây là lời nhắc nhở mạnh mẽ nhất rằng: Công nghệ không bao giờ dừng lại. Kẻ bám vào những khuôn mẫu cũ sẽ bị đào thải, nhưng những ai hiểu được bản chất của sự dịch chuyển sẽ nắm trong tay công cụ mạnh mẽ nhất từng được tạo ra trong lịch sử loài người.


Chỉ là những ghi chép cá nhân với hy vọng mang lại chút giá trị. Nếu thấy hữu ích, đừng ngại chia sẻ cho bạn bè & đồng nghiệp nhé!

Happy coding 😎 👍🏻 🚀 🔥.