14/08/2026
GLM-5.3 đang khiến cộng đồng AI nóng lên: model này có gì mà đáng chú ý vậy?
GLM-5.3 đang được bàn tán khá nhiều sau khi loạt benchmark mới xuất hiện. Lần này không chỉ có coding, mà còn có AI Agent, terminal, tool-use và cybersecurity.
🔥 CyberGym: 84.5
⚙️ AutomationBench: 48.2
💻 Terminal Bench 3.0: 28.3
🛡️ ExploitBench: 54.4
🏆 GDPVal-AA v2: 1769 Elo
Đặc biệt, Terminal Bench của GLM-5.2 được chia sẻ ở mức 4.6, lên GLM-5.3 thành 28.3. ExploitBench cũng tăng từ 24.4 → 54.4.
Nhìn tốc độ tăng này mới thấy GLM đang đẩy khá mạnh theo hướng AI Agent.
À, một thông tin cần nói rõ: GLM-5.3 đã được Z.ai chính thức ra mắt. Nhưng nếu đang chờ bản open-weight để tự host thì chưa có ngay. Z.ai cho biết weights dự kiến được phát hành sau khoảng 2 tuần, sau khi hoàn tất safety evaluation và hardening.
Còn chuyện “GLM-5.3 đã vượt GPT hay Claude chưa?” thì mình nghĩ chưa nên kết luận vội.
Ví dụ CyberGym đạt 84.5 là rất ấn tượng, nhưng sang ExploitBench thì vẫn còn khoảng cách khá lớn với model đứng đầu.
Nói đơn giản:
Tìm ra vulnerability tốt không có nghĩa là xử lý được toàn bộ bài toán từ A-Z.
Vậy nên mình xem GLM-5.3 là một model rất đáng để test, chứ chưa phải “GPT/Claude killer”.
Nếu đang làm coding agent, cứ lấy những task quen thuộc ra chạy thử: đọc repo, tìm bug, sửa code, dùng terminal, gọi tool, xử lý task dài... Những thứ này benchmark không nói hết được.
Điểm mình thích ở GLM vẫn là open-weight. Khi weights được phát hành, việc tự host, kiểm soát dữ liệu hay tùy chỉnh model sẽ dễ chủ động hơn khá nhiều.
Tốc độ từ GLM-5.2 lên GLM-5.3 đang khá đáng chú ý. Giờ chỉ còn chờ weights ra rồi quăng vào repo thật xem nó làm được tới đâu. 👀
Anh em nào đã dùng GLM-5.2 hoặc GLM-5.3 làm coding agent rồi, cho xin feedback thực tế nhé 👇