Tuần trước, tôi đang ngồi trong một buổi AMA với cộng đồng kỹ thuật tại Zurich thì điện thoại rung liên tục. Một loạt tin nhắn từ nhóm nghiên cứu AI của tôi: "Hân ơi, DeepSeek-V4-Pro API có vấn đề! Gọi cùng một prompt nhưng output khác nhau hoàn toàn." Tôi mở laptop, chạy thử vài lần, và quả thật – cùng một deepseek-v4-pro, nhưng có lần trả lời bắt đầu bằng "Let me", lần khác là "The user wants me", và một lần nữa lại dùng "we" một cách đầy tự tin. Cộng đồng lập tức đặt tên: "Ba phiên bản DeepSeek: Standard, Flash, và God Version." Nhưng là một người đã từng phân tích dữ liệu governance từ 50 DAO, tôi biết rằng những hiện tượng kỳ lạ thường có lời giải thích đơn giản hơn vẻ bề ngoài. Và lần này, câu trả lời nằm trong một commit trên GitHub.
Bối cảnh: Khi API nói nhiều hơn documentation
DeepSeek-V4-Pro là mô hình ngôn ngữ lớn thế hệ mới nhất của DeepSeek, được quảng cáo là có khả năng lập luận và agent vượt trội. Nhưng vào ngày 15 tháng 8, một số người dùng phát hiện rằng khi thay đổi IP hoặc tạo session mới, họ nhận được ba phong cách suy luận khác nhau. Một số người cho rằng DeepSeek đang ẩn giấu nhiều mô hình đằng sau API và phân phối chúng qua cơ chế routing. Điều này nghe có vẻ hợp lý – nhiều dự án AI đã từng làm điều tương tự, như khi OpenAI tung ra GPT-4 với nhiều biến thể. Nhưng nếu nhìn kỹ vào source code, câu chuyện lại khác.
DeepSeek Harness (DSH) là framework đánh giá agent của họ. Vào ngày 10 tháng 8, một commit quan trọng được cập nhật: fix(preset): align minimal agent with RL composition. Nói một cách đơn giản, commit này đảm bảo rằng môi trường Minimal Agent khớp với môi trường agent được sử dụng trong quá trình huấn luyện tăng cường (RL). Tài liệu chính thức cho thấy Minimal preset bao gồm một system prompt tối giản, một môi trường Bash liên tục, các công cụ chỉnh sửa cụ thể và một chính sách nén, trong khi loại bỏ các identity prompt, web prompt và mô tả công cụ bổ sung. Điều này có nghĩa là DSH Minimal không phải là phiên bản "cắt bớt" của Standard – nó mô phỏng môi trường agent thực tế mà mô hình gặp phải trong quá trình huấn luyện.
Phân tích cốt lõi: Môi trường đầu tiên quyết định tất cả
Cộng đồng đã thử nghiệm cùng một DeepSeek V4 Pro trên các môi trường Harness khác nhau và thu được kết quả đáng kinh ngạc: - DSH Standard: 91 điểm - DSH PTC: 92 điểm - DSH Minimal: 99/96 điểm
Sự chênh lệch 8 điểm giữa Standard và Minimal là rất lớn trong benchmark agent. Nhưng điều thú vị hơn là khi các tester phát triển plugin "Anchored Standard": yêu cầu đầu tiên mô phỏng môi trường Minimal (chỉ mở shell và read tools), và sau khi hoàn thành lời gọi công cụ đầu tiên, khôi phục toàn bộ bộ công cụ Standard. Kết quả? Điểm số liên tiếp đạt 98 và 99. Nói cách khác, chìa khóa cho hiệu suất của V4 Pro Agent không phải là số lượng công cụ cuối cùng, mà là những gì mô hình gặp đầu tiên: System Prompt + Tool Schema + Agent Scaffold.
Đối với một người đã từng thiết kế các cơ chế bỏ phiếu cho DAO, điều này gợi cho tôi một sự tương tự sâu sắc. Trong quản trị phi tập trung, bối cảnh ban đầu – cách bạn trình bày một đề xuất, các tùy chọn bỏ phiếu đầu tiên – thường quyết định kết quả hơn là bản thân nội dung. Đây là lý do tại sao tôi luôn nhấn mạnh tầm quan trọng của thiết kế giao diện người dùng trong governance. Và ở đây, DeepSeek đang cho thấy một nguyên lý tương tự: hiệu suất agent không phải là thuộc tính cố định của trọng số mô hình, mà là kết quả của sự tương tác giữa trọng số và môi trường suy luận đầu tiên.
Góc nhìn phản trực giác: Sự giàu có của công cụ là cạm bẫy
Chúng ta thường nghĩ rằng càng nhiều công cụ, agent càng mạnh. Nhưng dữ liệu từ DeepSeek lại cho thấy điều ngược lại: môi trường Minimal với ít công cụ hơn lại cho điểm cao hơn. Tại sao? Bởi vì trong quá trình RL, mô hình được huấn luyện để tối ưu hóa trong một không gian hành động hạn chế. Khi bạn đột nhiên mở rộng không gian đó với nhiều công cụ hơn, mô hình trở nên phân tâm – giống như một người mới bắt đầu chơi cờ vua mà có quá nhiều quân cờ, họ không biết nên di chuyển quân nào trước.
Điều này cũng giải thích tại sao cộng đồng lại thấy ba phong cách khác nhau. Có thể DeepSeek đang thử nghiệm nhiều cấu hình môi trường khác nhau trên API production – một số session chạy với preset gần với RL training, số khác chạy với preset đầy đủ. Và vì mô hình không thay đổi, chỉ có môi trường thay đổi, nên hành vi đầu ra khác nhau nhưng vẫn ổn định trong cùng một session. Đây là một giả thuyết hợp lý hơn nhiều so với chuyện có ba mô hình ẩn.
Từ AI đến DeFi: Một bài học về routing và thanh khoản
Nếu nhìn từ góc độ blockchain, hiện tượng này giống với cách các giao thức DeFi routing thanh khoản. Trong Uniswap V4, hooks có thể thay đổi hành vi của pool, nhưng thanh khoản cơ bản vẫn là một. Ở đây, trọng số mô hình là thanh khoản, còn môi trường suy luận là hooks. Thay đổi hooks có thể tạo ra hiệu suất khác nhau, nhưng không có nghĩa là có nhiều pool khác nhau. Tương tự, việc DeepSeek có thể đang A/B test các môi trường khác nhau trên API là một chiến lược thông minh để tối ưu hóa, nhưng cộng đồng đã nhầm lẫn giữa sự khác biệt về môi trường và sự khác biệt về mô hình.
Tôi đã từng chứng kiến điều tương tự trong một DAO mà tôi cố vấn: họ triển khai ba giao diện bỏ phiếu khác nhau cho cùng một hợp đồng thông minh, và kết quả là tỷ lệ tham gia thay đổi đáng kể. Mọi người đổ xô kết luận rằng có ba cơ chế bỏ phiếu khác nhau, nhưng thực tế chỉ là giao diện người dùng thay đổi. Bài học là: đừng nhầm lẫn giữa presentation layer và logic layer.
Kết luận: Một tương lai nơi môi trường là vua
Hiện tại, DeepSeek chưa xác nhận hay phủ nhận giả thuyết này. Nhưng nếu điều này đúng, nó mở ra một hướng đi mới cho việc tối ưu hóa agent: thay vì tập trung vào kiến trúc mô hình, chúng ta có thể tập trung vào thiết kế môi trường suy luận đầu tiên. Điều này đặc biệt quan trọng với các DAO đang xây dựng AI agents cho quản trị – một agent được khởi tạo trong môi trường đúng có thể outperform một agent mạnh hơn về mặt kỹ thuật nhưng bị overload bởi context.
Khi tôi nhìn vào hệ sinh thái blockchain, tôi thấy một sự tương đồng: giống như cách chúng ta thiết kế cơ chế đồng thuận (consensus) ảnh hưởng đến hành vi của mạng lưới, cách chúng ta thiết kế môi trường agent đầu tiên sẽ định hình hiệu suất của AI. Và câu hỏi dành cho cộng đồng: Liệu chúng ta có đang đánh giá thấp tầm quan trọng của system prompt trong các ứng dụng AI phi tập trung? Bởi vì nếu DeepSeek đã chứng minh được một điều, thì đó là: đôi khi, thứ bạn nhìn thấy không phải là sự thật, mà chỉ là ảo giác từ môi trường.