Tuần trước, một đồng nghiệp quant ở Seoul khoe với tôi: 'Tao dùng Grok /deep-research để phân tích on-chain của EigenLayer, nó cho ra báo cáo 20 trang, đẹp như của McKinsey.'
Tôi hỏi lại: 'Mày kiểm tra cái source nó dẫn chưa?'

Nó im.
Đó là vấn đề. Một công cụ hứa hẹn 'độ chính xác cao hơn' nhờ chạy song song nhiều AI agent, nhưng nếu tất cả cùng dựa trên một nguồn dữ liệu rác, kết quả chỉ là 'rác được đóng gói đẹp hơn'.
Context: /deep-research thực chất là gì?
Grok vừa giới thiệu lệnh /deep-research, được quảng cáo là 'nghiên cứu nâng cao với các tác nhân AI song song'. Về mặt kỹ thuật, nó phân rã một câu hỏi phức tạp thành nhiều nhiệm vụ con, giao cho nhiều agent AI xử lý đồng thời, rồi tổng hợp kết quả.
Nghe có vẻ giống Google Deep Research, AutoGPT hay bất kỳ framework agent nào. Điểm khác biệt duy nhất là Grok đóng gói nó thành một lệnh có sẵn trong product, thay vì để người dùng tự xây pipeline.
Nhưng đừng lầm tưởng đây là đột phá. Đây là engineering, không phải research. Cái khó nằm ở chỗ: làm sao để các agent không 'đồng thuận sai' (groupthink), và chi phí tính toán có đủ rẻ để scale hay không.
Core: Điểm mù của 'nghiên cứu song song'
Tôi đã thử vài hệ thống agent trước đây (bao gồm cả mấy cái open-source). Kinh nghiệm của tôi:
1. Task decomposition là nghệ thuật, không phải công thức. Cùng một câu hỏi 'Phân tích thanh khoản của Uniswap v3 trên Arbitrum', một agent sẽ tách thành 'lấy TVL', 'tính volume 7 ngày', 'kiểm tra fee'. Một agent khác lại tách thành 'so sánh với v2', 'xem pool concentrated liquidity nào đang hoạt động'. Không có chuẩn nào đúng tuyệt đối. Grok không nói rõ họ dùng thuật toán nào để decomposition.
2. Cross verification dễ tạo ảo tưởng. Parallel agent được cho là có thể kiểm tra chéo lẫn nhau. Nhưng nếu cả ba agent cùng crawl dữ liệu từ CoinGecko (cùng một nguồn), thì 'kiểm tra chéo' chỉ là copy-paste. Tôi từng thấy một bot yield farming của mình fail chỉ vì nó lấy giá từ một oracle duy nhất. Parallel agent cũng vậy: nếu không có nguồn độc lập, cross-check vô nghĩa.
3. Chi phí tính toán là quả bom hẹn giờ. Mỗi lần /deep-research có thể tiêu tốn gấp 10-100 lần một query thường. Nếu Grok không có cơ chế giới hạn hoặc pricing thông minh, hoặc là user sẽ bị charge đắt, hoặc là xAI chịu lỗ. Trong cả hai trường hợp, việc mở rộng user base đều khó. Tôi từng build hệ thống quant trading pool $5M, biết rõ chi phí inference là gì. Với parallel agent, bạn cần GPU cluster có NVLink hoặc InfiniBand, không phải cái nào cũng chạy được.
Contrarian: Tại sao trader không nên tin tưởng /deep-research?
Tôi thấy một nghịch lý: công cụ này sinh ra để tăng 'độ chính xác', nhưng thực tế nó dễ bị lạm dụng để tạo ra những báo cáo 'có vẻ chính xác' nhưng sai bản chất.
Hồi 2022, tôi mất 70% danh mục vì tin vào một phân tích on-chain của một công cụ AI thời đó. Nó cho thấy một đồng coin có 'accumulation đang tăng', nhưng thực ra đó là wash trading. Parallel agent sẽ không phát hiện được wash trading nếu nó không được train để nhận diện pattern đó, hoặc nếu nguồn dữ liệu (Dune Analytics bị thiếu filter) đã sai từ đầu.
Với một quant trader, thứ quan trọng nhất không phải là khối lượng thông tin, mà là tín hiệu có độ tin cậy cao. /deep-research có thể cung cấp nhiều thông tin, nhưng mỗi thông tin đều mang độ nhiễu. Khi bạn có 10 agent, bạn có 10 nguồn nhiễu nhân lên. Nếu không có cơ chế gán trọng số cho từng agent dựa trên độ chính xác lịch sử, kết quả tổng hợp chỉ là trung bình cộng của những sai lầm.
Grok tuyên bố 'tăng tính minh bạch' bằng cách hiển thị quy trình. Nhưng một trader giỏi biết rằng: quy trình minh bạch không đồng nghĩa với kết quả đúng. Tôi có thể show bạn toàn bộ code bot của tôi, nhưng nếu parameter sai, bot vẫn lỗ.
Takeaway: Công cụ cho người biết kiểm tra, không phải cho kẻ lười
/deep-research không phải là silver bullet. Nó là một công cụ mạnh nếu bạn sử dụng đúng cách: tự đặt câu hỏi, kiểm tra chéo nguồn, hiểu rõ hạn chế của nó. Nhưng nếu bạn dùng nó như một 'black box' để đưa ra quyết định trading, thì kết quả sẽ y hệt như những lần tôi mất tiền vì yield farming bot không có stop-loss.

Câu hỏi cuối cùng: Liệu một hệ thống parallel agent có thể vượt qua được một trader có 14 năm kinh nghiệm, biết cách đọc lệnh, hiểu tâm lý thị trường, và đã từng mất 70% danh mục? Hay nó chỉ là một cái máy tạo ra ảo tưởng về sự hiểu biết?
Tôi đặt cược vào con người. Nhưng tôi cũng sẽ dùng thử /deep-research để xem nó có học được gì từ sai lầm của tôi không.