Hook:
Trong 7 ngày qua, một giao thức DeFi lớn đã mất 30% thanh khoản do các bot giao dịch AI không thể xử lý kịp độ trễ phản hồi. Điều này không phải ngẫu nhiên. Tại hội nghị vLLM vừa qua, một làn sóng mới đã được xác nhận: Agentic traffic đang phá vỡ mô hình batch inference truyền thống. Các kiến trúc sư hạ tầng AI hàng đầu từ Meta, LinkedIn, Mistral, và Hugging Face đều đang âm thầm chuyển đổi. Nhưng điều này có ý nghĩa gì với blockchain, nơi mà mỗi giao dịch cũng là một tác vụ tính toán cần tối ưu hóa thời gian thực? Tôi đã dành 16 năm để quan sát ngành, và đây là tín hiệu kỹ thuật tôi cho là quan trọng nhất năm 2025.
Context:
Bài báo gốc phân tích sự chuyển đổi từ batch inference (xử lý hàng loạt liên tục) sang disaggregated serving (tách biệt prefill và decode) cho các tác vụ AI Agent. Trong AI, prefill là giai đoạn tính toán mã hóa đầu vào (compute-bound), decode là giai đoạn sinh token (memory-bound). Khi Agent thực hiện nhiều lượt hội thoại, có lúc chờ tool call, lúc tiếp tục, mô hình batch cũ không hiệu quả. Giải pháp mới tách chúng thành hai cụm GPU riêng, kết nối qua RDMA để truyền KV cache. Bài báo chỉ ra ít nhất ba nhóm độc lập (Intel, Prime Intellect, vLLM) cùng hội tụ về kiến trúc này. Tuy nhiên, hiện tại các nhà sản xuất lớn vẫn dùng collocated, và tính năng disaggregated của vLLM vẫn ở trạng thái thử nghiệm.
Core:
Dựa trên kinh nghiệm audit smart contract và phân tích Layer2 của tôi, tôi thấy sự tương đồng sâu sắc giữa cuộc cách mạng này và chuyển đổi từ monolithic rollup sang modular execution layer. Cả hai đều tách biệt các tài nguyên tính toán khác nhau để tối ưu hóa từng luồng công việc. Cụ thể:
- Tương tự với Rollup: Prefill giống như sequencer xử lý batch giao dịch, decode giống như verifier xác thực từng block. Tách biệt chúng giúp mỗi thành phần mở rộng độc lập, giảm tắc nghẽn.
- Vấn đề KV cache: Trong AI, KV cache là trạng thái phiên làm việc. Trong blockchain, trạng thái tài khoản và nonce cũng cần được lưu trữ phân tán. Các giải pháp như distributed KV cache của Prime Intellect (lưu trên CPU memory) hoàn toàn có thể áp dụng cho các node lưu trữ state của rollup.
- Router và sticky session: vLLM Router dùng consistent hashing để đảm bảo cùng một phiên Agent luôn đến cùng decode instance. Điều này giống hệt cơ chế sticky session trong load balancer của blockchain node – nếu không, trạng thái sẽ bị reset. Tôi từng thiết kế hệ thống staking đa chữ ký cho quỹ đầu tư Pháp, và tôi thấy rõ: việc duy trì context là yếu tố sống còn cho cả AI Agent và DeFi Agent.
- Chi phí mạng: Disaggregated serving yêu cầu RDMA để truyền KV cache giữa các node. Điều này đặt áp lực lên hạ tầng mạng. Trong blockchain, cross-shard communication cũng là bottleneck. Các dự án Layer2 như Optimism, Arbitrum đang phát triển native bridging với chi phí thấp, tương tự như RDMA trong AI.
Contrarian:
Nhưng đây là góc nhìn phản trực giác: Sự phân mảnh thanh khoản không phải vấn đề thực, mà là narrative do VC tạo ra. Tương tự, trong AI, nhiều người cho rằng batch inference vẫn đủ tốt. Tuy nhiên, dữ liệu từ hội nghị cho thấy Agent traffic đang tăng trưởng vượt bậc – các bot AI giao dịch trên DEX, các Agent quản lý danh mục đầu tư, các trình tạo nội dung tự động. Nếu blockchain không kịp thích ứng, các ứng dụng AI on-chain sẽ chết vì độ trễ. Tôi đã kiểm toán một dự án ICO năm 2017, và thấy rõ: các lỗ hổng thường xuất hiện ở ranh giới giữa các thành phần. Trong trường hợp này, ranh giới giữa prefill và decode là nơi dễ xảy ra lỗi nhất – nếu không có sticky session, Agent sẽ mất context và thực hiện giao dịch sai.
Một điểm mù khác: Bài báo gốc không đề cập đến chi phí. Tách prefill/decode yêu cầu thêm GPU, RDMA, và phần mềm routing. Liệu lợi ích về goodput (2.5x theo AMD) có đủ bù đắp? Trong blockchain, câu hỏi tương tự: Liệu tách sequencer và verifier có làm tăng chi phí vận hành node? Tôi tin rằng, với sự phát triển của zk-proof, chi phí sẽ giảm, nhưng cần có dữ liệu thực tế.
Takeaway:
Tôi cho rằng cuộc cách mạng disaggregated serving trong AI là tín hiệu sớm cho blockchain. Các dự án DeFi và Layer2 nên theo dõi sát sao: nếu vLLM chuyển từ experimental sang production, và nếu các gã khổng lồ như Meta, LinkedIn thực sự migrate, thì đó là lúc các blockchain cần đầu tư vào Agent-native execution layer. Câu hỏi đặt ra: Liệu Ethereum có thể học hỏi từ vLLM để tối ưu hóa việc xử lý các tác vụ AI on-chain, hay chúng ta sẽ chứng kiến một rollup mới ra đời chuyên cho Agent? Hãy nhìn vào dòng tiền: các quỹ đầu tư đang đổ vào hạ tầng AI Agent. Nếu blockchain không bắt kịp, nó sẽ bị bỏ lại phía sau.