
Agent Traffic Đang Phá Vỡ Batch Inference: Cuộc Pivot Hạ Tầng Mà Không Ai Ngờ
Hồ Tuệ
Một tweet từ vLLM Conference 2025 vừa lộ ra điều gì đó. Không phải một lỗi bảo mật. Mà là một sự thật phũ phàng: batch inference – thứ đang chạy hàng triệu request mỗi ngày – đang bị agent traffic bóp nghẹt. Tôi đọc xong agenda, cảm giác như hồi 2017 khi tôi phát hiện lỗi Enigma ICO. Cũng từ một tweet. Cũng chỉ sau 2 giờ. Cái khác là lần này, lỗi không nằm ở smart contract, mà nằm ở cách chúng ta xây dựng inference infrastructure.
Tại sao là bây giờ? Agent AI đang bùng nổ. Chatbot, coding assistant, tool calling agent – mỗi phiên đều kéo dài, nhiều lượt, có lúc dừng giữa chừng để gọi API. Batch inference truyền thống – vốn sinh ra cho request ngắn, độc lập – bắt đầu nghẹt thở. Như tôi từng thấy trong DeFi Summer 2020: khi yield farming nóng lên, Compound không chịu nổi, phải hard fork. Lần này, infrastructure đang bị agent traffic đẩy đến giới hạn. Và câu trả lời từ vLLM Conference là: disaggregated serving. Tách prefill và decode thành hai dịch vụ riêng.
Core của vấn đề: prefill – tính toán lần đầu để tạo KV cache – là compute-intensive. Decode – sinh token từng bước – là memory-bandwidth intensive. Ép chúng chạy cùng GPU là lãng phí. Tách ra, mỗi thứ dùng pool GPU riêng, tối ưu resource. Intel trình diễn prefill/decode decoupling. Prime Intellect dùng nguyên lý đó cho MoE 1T tham số. AMD còn đưa ra con số: MORI-IO trên 8x MI300X đạt 2.5x higher goodput. Tôi nhìn vào, nhớ lại hồi tôi cung cấp thanh khoản Compound: lúc đó tôi thấy yield flow chảy ngầm, nếu không nắm bắt là mất. Giờ đây dòng compute cũng vậy: nếu không tách prefill/decode, agent traffic sẽ chết ngạt.
Nhưng đừng vội mừng. Tôi đã từng mất 30 ETH trong FTX vì tin vào cảm xúc. Disaggregated serving không phải là silver bullet. Có một góc phản trực giác: nó làm tăng độ phức tạp hạ tầng gấp ba lần. KV cache phải truyền qua RDMA network. Bạn cần router mới để đảm bảo session stickiness. Prime Intellect phải build distributed KV storage. Nếu network latency cao, lợi ích mất sạch. Giống như Layer2: tưởng scale, nhưng thực ra cắt nhỏ thanh khoản. Disaggregated cũng có thể tạo ra prefill pool và decode pool riêng, nhưng nếu agent traffic chưa đủ lớn, bạn chỉ tốn thêm GPU và network. Hãy nhìn Meta, LinkedIn – họ vẫn đang chạy collocated. Chưa ai migrate. Đây mới là experimental.
Takeaway của tôi: infrastructure đang pivot, nhưng ai sống sót? Không phải kẻ chạy nhanh nhất, mà là kẻ chạy đúng lúc. Tôi sẽ theo dõi vLLM khi nào họ remove experimental flag. Tôi sẽ đọc benchmark từ Prime Intellect. Và quan trọng nhất: tôi sẽ không đặt cược tất cả vào trend này – giống như tôi đã từng sai với FTX. Dòng compute chảy ngầm, nhưng hãy để nó chảy qua chân bạn trước, rồi mới nhảy.