GLR: Khi LLM suy luận bằng hình học thay vì viết dài dòng
Geometric Latent Reasoning giúp LLM suy luận ngắn hơn đáng kể mà không cần dạy nó phải viết ngắn bằng cách đưa reasoning vào không gian embedding liên tục.
Nguyễn Nhật Long
@nguyennhatlong1303
Nếu bạn đã từng dùng các model reasoning như Qwen3 hay DeepSeek-R1, chắc bạn biết cái cảm giác ngồi chờ nó "suy nghĩ" đôi khi cả trang chain-of-thought trước khi ra đáp án. Với bài toán đơn giản thì ổn, nhưng khi scale lên production hay chạy batch inference, cái đuôi reasoning dài lê thê đó tốn token, tốn tiền, tốn thời gian. Một paper mới vừa drop trên Hugging Face tuần này Geometric Latent Reasoning (GLR) đề xuất một hướng tiếp cận khá thú vị: thay vì để model viết ra từng bước suy luận bằng ngôn ngữ tự nhiên, hãy để nó đi qua các bước đó trong không gian embedding.
Chain-of-thought đang bị giới hạn bởi chính ngôn ngữ
Chain-of-thought (CoT) hoạt động tốt vì nó buộc model phải externalize quá trình suy nghĩ từng bước được viết ra thành token, và mỗi token tiếp theo được condition trên toàn bộ context trước đó. Nhưng đây cũng chính là điểm yếu: reasoning bị ràng buộc vào discrete natural language. Mỗi bước phải là một token hợp lệ, phải đọc được, phải có nghĩa với con người.
Vấn đề là không phải mọi bước suy luận đều cần được diễn đạt bằng ngôn ngữ. Khi bạn nhẩm tính trong đầu, bạn không thực sự "nói" từng bước ra não bạn xử lý ở một dạng representation nào đó mà không nhất thiết phải map 1-1 với ngôn ngữ. GLR về cơ bản đang cố làm điều tương tự cho LLM.
GLR hoạt động như thế nào
Ý tưởng core của GLR là formulate latent reasoning như một bài toán geometric path approximation trong token embedding space của model. Cụ thể hơn:
- Model được pretrain bình thường, embedding space của nó đã encode semantic relationships giữa các token/concept.
- GLR thêm vào một transition head nhẹ về cơ bản là một module nhỏ học cách predict direction updates trong embedding space, thay vì predict token tiếp theo.
- Các CoT trace có sẵn được dùng làm anchor: GLR học để trajectory trong embedding space xấp xỉ với discrete reasoning path mà CoT đã đi, nhưng được phép deviate khỏi exact token embeddings.
Nói nôm na: thay vì đi từ token "Bước 1" → "Bước 2" → "Bước 3" qua discrete text, model đi từ vector A → vector B → vector C trong một không gian liên tục, rồi mới nhảy ra output cuối cùng bằng ngôn ngữ.
Cái hay là transition head này lightweight không cần retrain toàn bộ model, không cần kiến trúc mới từ đầu. Nó được train để học approximate các reasoning trajectory dựa trên CoT data có sẵn.
Cái emergent phenomenon khiến mình thấy thực sự thú vị
Kết quả đánh giá trên mathematical reasoning benchmarks với Qwen3 models cho thấy một điều mà các tác giả gọi là emergent phenomenon: khi dùng GLR, model tự nhiên sinh ra output ngắn hơn đáng kể mà không hề có bất kỳ explicit length objective nào trong training.
Đây là điểm mình thấy thực sự đáng chú ý. Thông thường nếu bạn muốn model viết ngắn hơn, bạn phải:
- Thêm length penalty vào loss function
- Fine-tune với preference data ("câu trả lời ngắn hơn tốt hơn")
- Prompt engineering kiểu "hãy trả lời ngắn gọn"
GLR không làm gì trong số đó. Việc rút ngắn output xảy ra tự nhiên vì các bước reasoning trung gian đã được "nén" vào latent space model không cần viết chúng ra nữa. Nó chỉ cần output phần cuối.
So sánh nhanh các approach:
| Approach | Reasoning ở đâu | Cần length objective? | Chi phí inference |
|---|---|---|---|
| Standard CoT | Explicit tokens | Không (mặc định dài) | Cao, tỉ lệ với độ dài CoT |
| CoT với length penalty | Explicit tokens | Có | Trung bình |
| Latent Thinking (COCONUT-style) | Hidden states | Không | Trung bình |
| **GLR** | Geometric path trong embedding space | **Không** | **Thấp hơn đáng kể** |
Tradeoff mới cần nghĩ tới
Paper này expose một tradeoff mới mà trước giờ mình chưa thấy được frame rõ ràng như vậy: latent computation budget vs output length vs accuracy.
Với CoT thông thường, bạn chỉ có một knob: output length (nhiều token hơn = suy luận nhiều hơn = thường accurate hơn). Với GLR, bạn có thêm một dimension: bao nhiêu bước latent bạn cho phép model thực hiện trước khi nó output.
Theo kinh nghiệm của mình khi làm với các reasoning model, cái tradeoff này thực ra rất quan trọng trong production. Đôi khi bạn không cần model accurate tuyệt đối bạn cần nó trả lời đủ nhanh với độ chính xác chấp nhận được. Với CoT, bạn chỉ có thể cắt bớt bằng cách... prompt nó viết ngắn hơn, vốn không phải lúc nào cũng reliable. GLR cho phép bạn control điều này ở level kiến trúc.
Còn những gì chưa rõ
Mình đọc paper và thấy vẫn còn một số câu hỏi chưa được trả lời thuyết phục:
Generalization ra ngoài math reasoning? Kết quả hiện tại chủ yếu trên mathematical benchmarks. Math có cấu trúc rõ ràng, các bước reasoning tương đối well-defined đây là môi trường lý tưởng để geometric path approximation hoạt động. Mình chưa chắc nó sẽ work tốt như vậy với coding tasks hay open-ended reasoning.
Training stability? Việc học approximate continuous trajectories từ discrete CoT traces nghe có vẻ tricky. Paper không đi sâu vào chuyện training có ổn định không, có bị mode collapse hay không.
Interpretability giảm mạnh. Một trong những lý do CoT được ưa chuộng là bạn có thể đọc và debug reasoning của model. Với GLR, phần reasoning quan trọng nằm trong latent space bạn mất đi khả năng đó. Trong các use case cần explainability (y tế, tài chính, legal), đây là vấn đề lớn.
Anh em lưu ý: đây vẫn là research paper, chưa có production-ready implementation hay open-source code được công bố. Nhưng direction này khá promising và mình nghĩ sẽ thấy nhiều follow-up work trong thời gian tới.
Bức tranh lớn hơn của latent reasoning
GLR không phải paper đầu tiên đi theo hướng này. Cùng thời điểm có một loạt paper đang explore latent reasoning theo các cách khác nhau từ COCONUT dùng continuous thought tokens, đến các approach dùng working memory của model, đến selective compression của reasoning chains. Điều này cho thấy community đang thực sự nghiêm túc với câu hỏi: liệu model có nhất thiết phải viết ra mọi thứ nó nghĩ không?
Mình thấy cái này hay ở chỗ nó đặt câu hỏi về một assumption rất cơ bản của toàn bộ paradigm CoT reasoning: rằng reasoning phải là ngôn ngữ. Nếu GLR và các paper tương tự chứng minh được rằng model có thể reason hiệu quả hơn trong latent space, thì chúng ta có thể đang nhìn vào một shift lớn trong cách design và deploy reasoning models từ "model viết dài để suy nghĩ" sang "model suy nghĩ ngầm, chỉ nói kết quả".
Về mặt engineering, điều đó có nghĩa là inference cost có thể giảm đáng kể mà không cần đánh đổi accuracy đó là thứ mà bất kỳ team nào đang chạy LLM ở scale đều muốn nghe.
Nguyễn Nhật Long
@nguyennhatlong1303Nguyễn Nhật Long is a Senior Frontend Engineer and Frontend Team Leader with 7 years of experience building real-time fintech platforms. Specializing in React, Next.js, TypeScript, and React Native, shipping 10+ products across Web, Mobile, Telegram Mini-Apps, and Web3.
Thấy hay? Chia sẻ cho bạn bè!

