
0,03 USD cho một "tác vụ" AI: Tín hiệu vĩ mô hay ảo ảnh từ blockchain?
Khi mọi người nhìn thấy con số 0,03 USD cho mỗi tác vụ AI, họ nghĩ ngay đến "rẻ đến khó tin". Tôi cũng nghĩ vậy. Nhưng suy nghĩ thứ hai của tôi là: tại sao một tin công nghệ về mô hình DeepSeek-V4-Flash lại được lan truyền qua các kênh blockchain, bắt nguồn từ một tài khoản giám sát không tên tuổi? Không có tài liệu kỹ thuật chính thức, không có mã nguồn mở, không có báo cáo đánh giá. Nhưng ba con số - 50 điểm chỉ số thông minh, 0,03 USD mỗi tác vụ, 99% tỷ lệ trúng cache - đã tạo ra một câu chuyện được chia sẻ rộng rãi. Trải nghiệm của tôi với đợt ICO OmiseGo năm 2017 dạy tôi rằng câu chuyện đẹp hiếm khi đứng vững trước thử thách của hạ tầng.
Để hiểu tại sao tin đồn này lại quan trọng, cần đặt nó vào bối cảnh rộng hơn. DeepSeek không còn là một cái tên xa lạ. Khi R1 xuất hiện, toàn bộ ngành AI phải điều chỉnh lại cách định giá. Câu chuyện "hiệu suất cao, chi phí thấp" trở thành vũ khí cạnh tranh lợi hại. Bây giờ, nếu V4-Flash thực sự ra mắt với mức giá ba xu một tác vụ, điều đó không chỉ là một cú hích cho DeepSeek mà là sự tái định nghĩa chi phí cho toàn bộ ngành công nghiệp phần mềm. Nhưng cẩn thận. Tôi đã học được từ mùa hè DeFi 2020 rằng những con số hấp dẫn thường phải trả giá bằng một dấu hoa thị. Khi tôi đầu tư 5.000 USDC vào Curve 3pool vì mức lợi suất 40% APR, tôi đã nhận ra impermanent loss 200 USD - chi phí ẩn mà không ai nhắc đến. Với V4-Flash, cái giá ẩn có thể là chính cấu trúc hạ tầng.
Và có một lớp bối cảnh nữa mà tôi không thể bỏ qua: chính trị của thông tin. Một tin đồn kỹ thuật không xuất phát từ phòng thí nghiệm hay các nhà phân tích công nghệ, mà lại xuất phát từ một tài khoản theo dõi thị trường trong cộng đồng blockchain. Điều này cho thấy ranh giới giữa tin tức kỹ thuật và tín hiệu đầu cơ đang ngày càng mờ nhạt. Trong thị trường tiền mã hóa, chúng ta đã quen với việc giá di chuyển dựa trên một dòng tweet. Nhưng khi ngành AI bắt đầu bị ảnh hưởng theo cách tương tự, câu hỏi về độ tin cậy của thông tin trở thành một vấn đề hạ tầng - và một vấn đề về thanh khoản trong cách chúng ta phân bổ sự chú ý.
Hãy bắt đầu với con số 50 điểm. Artificial Analysis tính tổng hợp điểm từ nhiều bài kiểm tra như MMLU, GPQA, HumanEval. Năm mươi điểm đưa mô hình này vào phân khúc trung bình: thông minh hơn những mô hình nhỏ, nhưng kém xa các mô hình hàng đầu vốn đạt 60-75 điểm. Đây không phải là sản phẩm đột phá về trí tuệ, mà là một sản phẩm chiến lược về chi phí.
Con số 0,03 USD mỗi tác vụ mới là nơi cần soi kỹ. Nếu đối chiếu với bảng giá công khai lịch sử của DeepSeek, để có một tác vụ giá 0,03 USD với 99% tỷ lệ trúng cache, mỗi tác vụ cần tiêu thụ hơn 2 triệu token đầu vào - một con số bất thường. Có ba khả năng. Một: mô hình này được định giá hoàn toàn khác so với dòng sản phẩm trước đó. Hai: "tác vụ" ở đây là một quá trình phức hợp gồm nhiều lần gọi, ngữ cảnh dài và nhiều công cụ - không phải một lần gọi API đơn giản. Ba: con số này đã được làm đẹp cho mục đích tiếp thị, một phiên bản "phòng thí nghiệm" của chi phí thực tế.
Điều đáng chú ý nhất là 99% tỷ lệ trúng cache. Tỷ lệ này không phải là một chỉ số về năng lực mô hình, mà là một thước đo về năng lực kỹ thuật hệ thống. Nó nói về khả năng của nhà cung cấp trong việc tái sử dụng các phần tiền tố công cộng trong bộ nhớ đệm KV Cache, một kỹ thuật đòi hỏi sự tinh vi trong phân trang bộ nhớ và lập lịch tác vụ. Nhưng quan trọng hơn, 99% không phải là một con số xuất hiện tự nhiên. Nó là thành quả của một quá trình thiết kế sản phẩm chặt chẽ. Nhà phát triển sử dụng mô hình phải được hướng dẫn để sử dụng các mẫu hệ thống chia sẻ, tiền tố được chuẩn hóa, lời nhắc có cấu trúc. Chi phí thấp chỉ dành cho những người sẵn sàng tuân theo một khuôn mẫu. Bạn không mua một mô hình rẻ; bạn tham gia vào một hệ thống yêu cầu bạn tuân theo một trật tự cụ thể.
Tôi đã nhìn thấy sự tương đồng này trong lĩnh vực tài chính phi tập trung. Khi Uniswap V4 giới thiệu Hooks, tôi viết rằng nó biến DEX thành một bộ Lego có thể lập trình. Nhưng sự phức tạp tăng vọt sẽ làm mất lòng 90% nhà phát triển. Với V4-Flash, một trò chơi tương tự đang diễn ra: bạn được mời vào một hệ thống có chi phí thấp, nhưng chỉ khi bạn chấp nhận giới hạn về cách bạn xây dựng ứng dụng. Sự tự do có một cái giá, và cái giá đó nằm trong các con số mà không ai nói đến.
Gần đây, trong một dự án hackathon năm 2026, nhóm của tôi đã xây dựng một hệ thống định tuyến thanh toán đa chuỗi sử dụng học tăng cường. Rào cản lớn nhất không phải là việc thiếu một mô hình thông minh, mà là chi phí của hàng triệu lần gọi suy luận để tối ưu hóa quyết định theo thời gian thực. Nếu các con số của V4-Flash là thật, nó sẽ thay đổi toàn bộ phương trình kinh tế của những ứng dụng như của chúng tôi. Nếu không, nó vẫn là một tín hiệu về hướng đi của ngành. Tôi đã giữ liên lạc với một quỹ đầu tư mạo hiểm quan tâm đến mô hình này, và họ nói với tôi một câu khiến tôi nhớ mãi: "Trong một thị trường mà mọi thứ có vẻ rẻ hơn, thứ đắt nhất vẫn là sự chú ý để nhìn ra bản chất."
Nhưng đây chính là điểm mù của thị trường. Chúng ta đang tranh luận về việc V4-Flash có tồn tại hay không, trong khi câu chuyện thực sự là: một tin đồn về chi phí AI đã tìm được đất sống trên nền tảng blockchain. Điều đó nói lên một sự hội tụ đang diễn ra. Các ứng dụng tiền mã hóa - từ agent giao dịch tự động đến giao thức thanh toán xuyên biên giới - đang trở thành những người tiêu dùng AI lớn nhất, và chi phí suy luận là yếu tố quyết định sự sống còn.
Tôi thấy điều gì đó quen thuộc. Giống như việc Binance sau khi bị phạt 4,3 tỷ USD lại đứng vững hơn bởi hào quy định cao hơn, ngành AI có thể đang tiến tới một hiện trạng nơi chi phí thấp và hạ tầng suy luận tối ưu trở thành hào cạnh tranh chính. Hàng chục Layer2 trong thị trường tiền mã hóa đã dạy tôi rằng sự phân mảnh không phải là mở rộng; nó là cắt nhỏ thanh khoản vốn đã khan hiếm. Một kịch bản tương tự có thể xảy ra khi các mô hình giá rẻ xuất hiện ngày càng nhiều: thay vì mở ra một thị trường thống nhất, chúng tạo ra một mê cung các lựa chọn và định giá phức tạp.
Và nếu 2022 đã dạy tôi điều gì, đó là khi thanh khoản toàn cầu thắt chặt, mọi tài sản rủi ro đều bị bán tháo. Tương tự, khi một con số chi phí xuất hiện mà không có sự hỗ trợ của dữ liệu kiểm chứng, nó có thể gây ra một đợt điều chỉnh kỳ vọng mạnh mẽ. Các nhà đầu tư nhìn thấy "siêu rẻ" và mơ về việc áp dụng rộng rãi, nhưng khi con số thực tế lộ ra - với chi phí ẩn của cache trượt, giới hạn tốc độ và các mô hình phức hợp - họ có thể quay lại và trừng phạt các cổ phiếu công nghệ cao.
Trong khi chờ DeepSeek xác nhận hay phủ nhận, câu hỏi đáng giá nhất không phải là "V4-Flash có thật không?". Câu hỏi thực sự là: nếu chi phí một tác vụ suy luận giảm xuống còn ba xu, bạn sẽ xây dựng điều gì mà trước đây là bất khả thi? Và quan trọng hơn, bạn có đọc được những gì không được viết trong con số đó không? Vì giống như thanh khoản, chi phí chỉ là một lời hứa cho đến khi bạn nhìn thấy cấu trúc nằm bên dưới.