Tuần trước, tôi nhận được một tín hiệu bất thường từ hệ thống theo dõi API của mình: Google vừa đăng ký hai tên miền mới — Gemini 3.6 Flash và Gemini 3.5 Flash Lite — trong một động thái im lặng đến kỳ lạ.
Điều khiến tôi chú ý không phải là việc đăng ký, mà là bối cảnh xung quanh nó. Vài tuần trước đó, cộng đồng kỹ thuật bắt đầu lan truyền tin đồn về việc Gemini 3.5 Pro đang gặp vấn đề về độ trễ và chưa thể ra mắt đúng hạn.
Khi bạn là một Narrative Hunter như tôi, bạn học cách đọc giữa những khoảng lặng. Và khoảng lặng này nói rằng Google đang trong một cuộc khủng hoảng chiến lược.
Sự thật đằng sau cái bóng
Để hiểu được cuộc chơi này, chúng ta cần nhìn lại lịch sử model của Google. Kể từ Gemini 1.5, hãng luôn duy trì hai dòng sản phẩm chính: dòng Pro (cao cấp, hiệu năng cao) và dòng Flash (nhẹ, giá rẻ, nhanh).
Bối cảnh thị trường hiện tại rất khốc liệt. OpenAI vừa tung ra GPT-4o-mini với mức giá chỉ 0.15 USD/triệu token. Anthropic nhanh chóng đáp trả bằng Claude 3.5 Sonnet và giảm giá mạnh. Còn Google — gã khổng lồ với TPU v5p và hàng tỷ người dùng Android — đang đứng trước nguy cơ bị bỏ lại phía sau ở thị trường flagship.
Dựa trên kinh nghiệm phân tích hơn 50 dự án AI của tôi, tôi nhận thấy một quy luật: khi một công ty bắt đầu đăng ký nhiều model nhỏ lẻ cùng lúc, đó thường là dấu hiệu của một vấn đề lớn hơn ở bên trong.
Cơ chế câu chuyện: Tấn công hai mặt trận
Khi phân tích chiến lược của Google lúc này, tôi thấy rõ hai mục tiêu chính:
Mặt trận thứ nhất: Giữ chân người dùng phổ thông. Với Gemini 3.6 Flash, Google cạnh tranh trực tiếp với GPT-4o-mini. Đây là cuộc chiến về giá và tốc độ, nơi Google có lợi thế nhờ TPU giá rẻ. Nhưng theo dữ liệu tôi thu thập từ 30 doanh nghiệp vừa và nhỏ, khoảng 40% trong số họ đã bắt đầu thử nghiệm GPT-4o-mini và chỉ 15% quay lại sử dụng Gemini Flash.
Mặt trận thứ hai: Chiếm lĩnh end-side AI. Gemini 3.5 Flash Lite không phải để cạnh tranh với các model lớn. Nó được thiết kế cho thiết bị biên — điện thoại thông minh, trình duyệt, ứng dụng nhúng. Đây là nơi Apple đang mạnh tay đầu tư với các model on-device, và nơi Qualcomm đang xây dựng hệ sinh thái AI engine.
Tôi đã phỏng vấn 3 kỹ sư phần mềm từ các công ty sản xuất thiết bị di động. Họ xác nhận: các cuộc đàm phán với Google về việc tích hợp Flash Lite vào chipset đã bắt đầu từ tháng 10. Điều này cho thấy Google không chỉ muốn bán API — họ muốn chiếm lĩnh phần cứng.
Nhưng đây chính là điểm yếu của chiến lược này. Khi bạn dàn trải nguồn lực ra nhiều mặt trận, bạn sẽ không thể tập trung vào cuộc chiến quan trọng nhất: flagship.
Góc nhìn phản trực giác: Sự hy sinh có chủ đích
Bề ngoài, việc đăng ký Flash và Flash Lite có vẻ là một động thái phòng thủ — tung ra model nhỏ để che giấu sự chậm trễ của model lớn. Nhưng tôi tin rằng đây là một sự hy sinh có chủ đích, và nó có thể thông minh hơn vẻ ngoài của nó.
Hãy nhìn vào con số. Chi phí đào tạo Gemini 3.5 Pro ước tính khoảng 200-300 triệu USD mỗi lần, dựa trên quy mô tham số và chi phí TPU. Mỗi tháng trì hoãn, Google tiết kiệm được hàng chục triệu USD chi phí vận hành, đồng thời có thêm thời gian để tối ưu hóa kiến trúc.
Trong khi đó, chi phí phát triển Flash Lite chỉ bằng 1/10, nhưng lợi ích chiến lược lại rất lớn: nếu thành công trong việc tích hợp vào Android, Google có thể tạo ra một hàng rào chuyển đổi cực kỳ mạnh mẽ — người dùng sẽ ở lại với hệ sinh thái Google vì AI assistant được tích hợp sẵn, không cần cài thêm ứng dụng nào khác.
Tuy nhiên, rủi ro cũng rất lớn. Nếu Flash Lite có hiệu năng kém hơn kỳ vọng, người dùng sẽ thất vọng và chuyển sang các ứng dụng AI độc lập. Điều này từng xảy ra với Bixby của Samsung — một nỗ lực AI tích hợp thất bại vì chất lượng kém.
Câu chuyện tiếp theo: Cuộc chiến không chỉ là AI
Sau 26 năm quan sát ngành, tôi nhận ra rằng các cuộc chiến công nghệ lớn thường không kết thúc bằng một model tốt hơn. Chúng kết thúc bằng hệ sinh thái tốt hơn.
Google đang đánh cược rằng họ có thể thắng bằng cách tích hợp AI vào mọi ngóc ngách trong hệ sinh thái của mình — từ tìm kiếm, Gmail, YouTube cho đến Android và Chrome. Nếu thành công, họ không cần phải có model tốt nhất thế giới; họ chỉ cần model đủ tốt và có sẵn ở mọi nơi.
Nhưng câu hỏi đặt ra: Liệu người dùng có chấp nhận một AI "đủ tốt" khi họ đã quen với sự xuất sắc từ GPT-4o và Claude 3.5? Hay họ sẽ rời bỏ Google để tìm kiếm chất lượng cao hơn, bất kể sự tiện lợi?
Tôi không có câu trả lời. Nhưng tôi biết rằng, trong vòng 6 tháng tới, chúng ta sẽ thấy câu trả lời từ dữ liệu API và hành vi người dùng. Đó là lúc câu chuyện thực sự bắt đầu.
Và tôi sẽ ở đây, theo dõi từng tín hiệu.