Google Gemini 3.6 Flash: Cuộc đua Agent và cái bẫy 'tối ưu' mà không ai nói
Bùi Hưng
Tuần này, Google âm thầm mở khóa Gemini 3.6 Flash. Không phải phiên bản 4.0 đình đám, chỉ là một bản vá hiệu suất. Nhưng với dân săn tín hiệu như tôi, đây không phải tin tức thường. Đây là tín hiệu cho thấy Google đang chơi ván cờ hoàn toàn khác: đánh vào túi tiền của Agent developer thay vì chạy đua benchmark vô bổ. Và nếu anh em đang xây bot trên Solana hay Arbitrum, hãy đọc kỹ – chi phí vận hành của anh em sắp thay đổi.
Tại sao bây giờ? Bối cảnh thị trường AI đang ở pha “đi ngang” giống hệt crypto post-halving. OpenAI kẹt với GPT-5, Anthropic đau đầu với safety. Google chọn pivot: thay vì ra model to hơn, họ làm model rẻ hơn và thông minh hơn trong agent loop. Output token giảm 17% nhờ cắt bớt inference steps. Giá output từ $9 xuống $7.5 mỗi triệu token. Nghe có vẻ không nhiều, nhưng nếu anh em chạy agent trading bot quét 1000 pool mỗi giờ, con số này là chênh lệch giữa profit và break-even.
Cốt lõi kỹ thuật: Gemini 3.6 Flash không phải là một model mới về architecture. Nó là version “distilled” của Gemini 3.5 Flash với inference path optimization. DeepSWE tăng từ 37% lên 49%, MLE Bench từ 49.7% lên 63.9%. Cả hai đều là agent-heavy benchmarks. Điều đó có nghĩa: Google không cố cải thiện khả năng suy luận triết học, họ tập trung vào tool calling và planning. Nhìn từ góc độ của một người từng viết bot trade năm 2020, tôi thấy rõ sự tương đồng: giống như tôi từng tối ưu vòng lặp quét pool Uniswap bằng cách skip các pool vô dụng. Kết quả: cùng một bot, lợi nhuận tăng 30% mà không cần thêm vốn. Google đang làm điều tương tự với agent stack.
Nhưng đây mới là phần thú vị: tôi gần như chắc chắn Google đã sử dụng kỹ thuật “speculative decoding” hoặc “rejection sampling” để rút ngắn execution path. Và điều đó mang lại hiệu ứng phụ – model có thể trở nên “thiếu kiên nhẫn” hơn, bỏ qua các bước an toàn để tiết kiệm token. Năm 2021, tôi từng mất 30 ETH vì bot mint NFT của tôi quá nhanh, không check được hết các edge case dẫn đến fail. Cái giá của tốc độ là sự tin cậy. Với Gemini 3.6 Flash, các agent sẽ nhanh hơn, nhưng liệu có an toàn hơn? Bài báo gốc không đề cập gì về safety benchmark. Đây là điểm mù mà các nhà phát triển Agent cần tự đánh giá.
Contrarian angle: mọi người đang quá tập trung vào Gemini 4 sắp tới, nhưng thực tế Gemini 3.6 Flash mới là sản phẩm kiếm tiền ngay. Hãy nhìn giá: output $7.5, cộng với token tiết kiệm 17%, chi phí thực tế giảm ~31% so với Gemini 3.5 Flash. Đây là đòn tấn công trực diện vào GPT-4o ($15) và Claude 3.5 Sonnet ($15). Với cùng số tiền, developer có thể gọi gấp đôi số lượng agent task. Đó là lý do tôi nghĩ, trong 3 tháng tới, thị phần AI agent của Google Cloud sẽ tăng vọt, bất chấp Gemini 4 chưa ra. Nhưng rủi ro: nếu Open AI nhanh chóng tung GPT-5 với giá tương tự, tất cả lợi thế này sẽ tan biến. Đây là game của speed, không phải tech superiority.
Lấy điều gì cho trader và builder? Theo dõi Vertex AI API usage của Google Cloud trong Q3 báo cáo tài chính. Nếu growth rate vượt kỳ vọng, đó là xác nhận cho thesis của tôi. Còn với anh em build bot: chuyển sang Gemini 3.6 Flash ngay nếu agent của anh em là high-frequency, vì chi phí thấp hơn sẽ kéo dài runway. Nhưng nhớ test safety. Tôi từng nghĩ mình thông minh khi xây bot quét yield farming nhanh nhất, cuối cùng mất trắng vì không anticipate được edge case. Tốc độ không thay thế được kỹ thuật. Và khi Google càng tối ưu Agent, chúng ta càng phải xây dựng fail-safe cho những bot “quá nhanh” đó.