Họ bảo đây là bước tiến trong nghiên cứu AI. Tôi bảo đây là một bài toán chi phí chưa có lời giải.
Một dòng tweet ngắn ngủi từ đội ngũ Grok: “Chúng tôi giới thiệu lệnh /deep-research, sử dụng các tác tử AI song song để thực hiện nghiên cứu chuyên sâu, nâng cao độ chính xác và minh bạch.” Sáu giờ sau, hàng trăm bài đăng ca ngợi “kỷ nguyên mới của tri thức tự động”. Nhưng tôi chỉ thấy một lớp sơn mới trên một mô hình cũ: agent đa bước, nhưng được đóng gói lại dưới cái tên hot.
Lỗ hổng? Tôi đã thấy nó từ hôm qua. Năm 2020, tôi stake 4 ETH vào một pool thanh khoản fork của Uniswap. Dự án đó cũng hứa hẹn “tính minh bạch” và “độ chính xác”. Ba tuần sau, thanh khoản biến mất. Tôi viết script Python quét 20 pool tương tự và phát hiện ra một sự thật: mọi lời hứa về độ chính xác đều chỉ có giá trị khi bạn kiểm tra được mã nguồn. Với Grok, tôi không có quyền kiểm tra. Chỉ có một tuyên bố.
Hãy mổ xẻ /deep-research dưới góc nhìn của một người đã dành 13 năm mò mẫm trong mã nguồn của những dự án blockchain và AI. Tôi sẽ không dùng các công cụ phân tích sẵn có. Tôi tự build mọi thứ. Bắt đầu.
Context: Bối cảnh của một lời hứa quen thuộc
AI agent là cụm từ được tung hô suốt năm 2024. Từ AutoGPT đến các framework như LangChain hay CrewAI, ý tưởng về một nhóm AI làm việc song song để giải quyết vấn đề phức tạp đã có từ lâu. Grok không phải người đầu tiên. Google Deep Research, Perplexity Pro, thậm chí các plugin của ChatGPT đều có khả năng gọi nhiều chain-of-thought. Vậy điều gì khiến /deep-research khác biệt?
— Đó là “song song” và “minh bạch”. Hai từ này nghe rất kỹ thuật. Nhưng khi tôi đọc kỹ thông báo, không có một con số nào. Không benchmark. Không so sánh với GPT-4o hay Claude 3.5. Không có ví dụ cụ thể về một tác vụ nghiên cứu nào. Đây là dấu hiệu ruột của tôi: một dự án càng hứa hẹn “chính xác” thì càng có nhiều khả năng nó đang giấu đi phần vỡ mặt.
Audit bị từ chối? Đã biết trước rồi. Năm 2021, một nhóm phát triển mời tôi audit một bản sao BAYC. Họ cũng nói về “minh bạch” và “an toàn”. Tôi phát hiện hai backdoor cho phép mint vô hạn. Tôi từ chối ký audit. Hai tháng sau, dự án bị hack mất 120 ETH. Với Grok, tôi không thể audit. Nhưng tôi có thể suy luận từ những gì họ không nói.
Core: Tháo gỡ hệ thống – Còn nhiều hơn những gì được quảng cáo
Tôi đã xây dựng pipeline phân tích rủi ro cho các quỹ đầu tư. Tôi biết một hệ thống “nghiên cứu chuyên sâu” cần những gì: task decomposition, memory management, verification loop, và cost control. Grok không công bố bất kỳ cơ chế nào. Vậy tôi phải dựa vào kiến thức nền để phơi bày những điểm mù.
1. Task decomposition: Làm sao để chia một câu hỏi phức tạp thành nhiều sub-task? Có hai hướng: dùng LLM tự phân tích (kiểu ReAct) hoặc dùng template cứng. Cái đầu linh hoạt nhưng hay bị lạc. Cái sau an toàn nhưng hạn chế. Grok không nói họ dùng cái nào. Nếu họ dùng LLM để tự phân tích, tôi đặt cược 70% rằng kết quả sẽ không ổn định trên các câu hỏi có nhiều biến số. Kinh nghiệm từ việc build script phân tích rug pull năm 2020 dạy tôi: khi bạn để AI tự quyết định chiến lược, bạn sẽ mất kiểm soát ở bước thứ ba.
2. Parallel execution cost: Đây là vấn đề lớn nhất. Mỗi agent chạy song song tiêu tốn tài nguyên gấp 10-100 lần một query đơn. Trong thị trường tăng hiện tại, ai cũng muốn tốc độ. Nhưng chi phí vận hành (GPU, điện, cooling) đang tăng. Nếu Grok không có cơ chế giới hạn số lượng agent hoặc thời gian chạy, họ sẽ cháy tiền. Tôi đã thấy kịch bản này trong DeFi Summer: các dự án yield farming hứa lợi nhuận cao, nhưng chi phí khai thác vượt quá phần thưởng. Kết cục: sụp đổ. Với /deep-research, nếu mỗi lần chạy tốn $0.5 mà người dùng chỉ trả $10/tháng, mô hình không bền vững.
3. Verification loop: Họ nói “minh bạch”. Nhưng làm sao để một agent kiểm tra kết quả của agent khác? Nếu tất cả đều dùng chung một mô hình nền (Grok), chúng có thể bị nhiễm cùng một bias. Tôi gọi đây là “echo chamber of hallucination”. Năm 2022, khi phân tích sự sụp đổ của Terra, tôi phát hiện rằng nhiều “chuyên gia” trên Twitter đều dùng chung một nguồn dữ liệu on-chain, dẫn đến đám đông đồng thuận sai. Với AI agent, rủi ro này nhân lên gấp bội.
4. Long context: Một nghiên cứu sâu có thể cần xử lý hàng trăm trang tài liệu. Các mô hình hiện tại (GPT-4o, Claude 3.5) hỗ trợ 128K-200K token. Nhưng Grok? Không rõ. Nếu context window nhỏ, kết quả tổng hợp sẽ mất mát thông tin. Tôi đã thử nghiệm với các script phân tích on-chain: khi context vượt quá 8K token, chất lượng suy luận giảm rõ rệt. Đây là giới hạn vũ lực.
Contrarian: Góc nhìn của phe bò – Tại sao họ có thể đúng?
Tôi không phải người luôn phủ định. Có một kịch bản mà /deep-research thành công: nếu Grok thực sự xây dựng được một kiến trúc tách biệt giữa các agent, với cơ chế kiểm tra chéo độc lập dựa trên nhiều nguồn dữ liệu khác nhau (không chỉ web mà còn real-time X feeds, paper databases, code repos). Điều này sẽ tạo ra một lớp xác thực mạnh. Thậm chí, nếu họ dùng các mô hình nhỏ chuyên biệt cho từng bước (tìm kiếm, tóm tắt, so sánh), chi phí có thể giảm đáng kể.
Ngoài ra, nếu họ tận dụng được dữ liệu độc quyền từ X – những dòng tweet, bài phân tích, tin tức nóng – họ có thể vượt trội so với Google hay Perplexity, vốn chỉ crawl web công khai. Đây là lợi thế độc nhất. Tôi từng thấy các quỹ đầu tư trả hàng trăm nghìn USD để có quyền truy cập sớm vào dữ liệu on-chain. Nếu Grok biến /deep-research thành một “Bloomberg Terminal cho AI”, họ có thể định giá cao.
Nhưng để làm được điều đó, họ cần giải quyết vấn đề chi phí và tin cậy. Tôi chưa thấy bằng chứng. Họ nói “minh bạch” – vậy hãy công bố nội bộ của một agent, cho tôi thấy các bước suy luận. Họ nói “chính xác” – vậy hãy so sánh với GPT-4o trên 1000 câu hỏi trong lĩnh vực blockchain, nơi tôi biết rõ đâu là đúng sai. Hiện tại, tôi chỉ thấy một lời hứa.
Takeaway: Lời kêu gọi trách nhiệm
Tôi sẽ không đầu tư thời gian vào /deep-research cho đến khi tôi thấy mã nguồn hoặc ít nhất là một báo cáo audit độc lập. “Minh bạch” không phải là một câu khẳng định, nó là một quá trình có thể kiểm chứng. Cộng đồng AI từng bị lừa bởi những lời hứa về “trí tuệ tổng quát” – giờ đây chúng ta lại bị cám dỗ bởi “tác tử nghiên cứu”.
Hãy nhớ: mỗi khi một dự án hứa hẹn độ chính xác mà không đưa ra dữ liệu, hãy đặt cược ngược lại. Tôi đã làm vậy với hàng trăm ICO, DeFi, và NFT. Tôi sẽ làm vậy với Grok. Nếu họ chứng minh được, tôi sẵn sàng thay đổi quan điểm. Nhưng cho đến lúc đó, tôi sẽ viết script của riêng mình – như tôi vẫn làm – và không giao phó nghiên cứu của mình cho một hộp đen song song mà tôi không thể kiểm tra.