BTC $79,001.64 -0.87%
ETH $2,480.12 -0.17%
BNB $739.35 -1.10%
XRP $1.39 -1.39%
SOL $103.77 -2.39%
TRX $0.3340 -0.33%
DOGE $0.0900 +0.92%
ADA $0.2207 +0.80%
BCH $267.50 +4.22%
LINK $12.92 +4.63%
HYPE $85.60 -2.83%
AAVE $132.19 -0.94%
SUI $0.8133 +1.57%
XLM $0.1925 +4.18%
ZEC $1,158.07 -1.76%
BTC $79,001.64 -0.87%
ETH $2,480.12 -0.17%
BNB $739.35 -1.10%
XRP $1.39 -1.39%
SOL $103.77 -2.39%
TRX $0.3340 -0.33%
DOGE $0.0900 +0.92%
ADA $0.2207 +0.80%
BCH $267.50 +4.22%
LINK $12.92 +4.63%
HYPE $85.60 -2.83%
AAVE $132.19 -0.94%
SUI $0.8133 +1.57%
XLM $0.1925 +4.18%
ZEC $1,158.07 -1.76%

Ngã tư của AI: Tại sao Phố Wall đang nói "không" với ChatGPT và Claude?

Quan điểm cốt lõi
Summary: Trong lĩnh vực mà công ty alpha hoạt động, các mô hình mở được điều chỉnh bởi các chuyên gia đã đồng thời vượt qua các tiêu chuẩn tiên tiến về độ chính xác và chi phí, trong khi cơ sở hạ tầng để xây dựng nó trong môi trường bảo mật đang đến từng nút một.
IOSG Ventures
2026-07-13 22:47:22
Trong lĩnh vực mà công ty alpha hoạt động, các mô hình mở được điều chỉnh bởi các chuyên gia đã đồng thời vượt qua các tiêu chuẩn tiên tiến về độ chính xác và chi phí, trong khi cơ sở hạ tầng để xây dựng nó trong môi trường bảo mật đang đến từng nút một.

Tác giả: Jeff @IOSG

Tại sao cần AI riêng tư

Ngày 1 tháng 7, CEO của Palantir, Alex Karp, đã có một cuộc phỏng vấn kéo dài 20 phút trên CNBC, được một số phương tiện truyền thông gọi là "sự sụp đổ tinh thần". Theo Karp, các doanh nghiệp đang trả tiền cho các phòng thí nghiệm tiên tiến với mức giá token cao, trong khi IP của họ đang chảy vào các nhà cung cấp mô hình. Ông gọi sự rò rỉ này là sự chuyển giao alpha, và sự chuyển giao đang diễn ra ở cấp kiến trúc: mỗi yêu cầu gửi đến mô hình đóng nguồn đều đến máy chủ của nhà cung cấp dưới dạng văn bản rõ. Ngay trước khi chương trình phát sóng, Palantir vừa công bố hợp tác với NVIDIA để chạy mô hình Nemotron mở trong môi trường tự kiểm soát của khách hàng, kèm theo một tuyên ngôn về chủ quyền AI gồm chín điểm. Sau khi chương trình CNBC phát sóng, PLTR đã tăng vọt 8%. Ngã tư của AI: Tại sao Phố Wall đang nói Trong hai mươi năm qua, các doanh nghiệp đã dựa vào sự tin tưởng ở cấp độ giao thức để áp dụng phần mềm đám mây, và điều này đã hoạt động. Mỗi nhà cung cấp SaaS chỉ nhìn thấy một phần dữ liệu của doanh nghiệp, hầu hết cũng không có động lực để sử dụng dữ liệu khách hàng để cải thiện sản phẩm cốt lõi. Salesforce nhìn thấy kênh bán hàng, Workday nhìn thấy nhân sự, Jira nhìn thấy phát triển lặp, AWS cung cấp nền tảng lưu trữ và tính toán. Tuy nhiên, ngày nay, quy trình làm việc AI yêu cầu tải lên toàn bộ tài sản một lần, cùng với ngữ cảnh có cấu trúc kết nối các phòng ban, nhằm tối đa hóa năng suất. Bỏ qua thiện chí, các nhà cung cấp dịch vụ thượng nguồn hiện có thể sử dụng những dữ liệu này để phát triển các tính năng mới, thay vì để chúng nằm trên máy chủ và bị bỏ quên.

Không ai đang giảm tốc độ, doanh thu hàng năm của Anthropic đã đạt 47 tỷ USD vào tháng 5, tăng mạnh so với 9 tỷ USD vào cuối năm 2025, trong khi OpenAI đã vượt qua 900 triệu người dùng hoạt động hàng tuần vào tháng 2. Cả hai công ty đều đã hoàn thành một vòng tài trợ mới vào mùa xuân năm nay, với định giá gần 1 nghìn tỷ USD, và dự kiến sẽ IPO với giá trị thị trường cao hơn. Nhiều năm cáo buộc về quyền riêng tư và IP không khiến hai công ty này mất đi chút động lực nào.

Một số doanh nghiệp đã hành động từ lâu. Vào tháng 2 năm 2023, chưa đầy ba tháng sau khi ChatGPT ra mắt, các ngân hàng lớn trên Phố Wall đã hạn chế việc sử dụng nó. Vào tháng 5 năm 2023, sau khi một kỹ sư của Samsung để lộ mã nguồn chip vào ChatGPT, công ty đã cấm hoàn toàn AI sinh tạo trên toàn mạng. Để đáp lại, OpenAI đã ra mắt ChatGPT Enterprise vào tháng 8 cùng năm, cam kết không sử dụng dữ liệu thương mại để huấn luyện, cộng thêm giao thức không lưu giữ dữ liệu (zero-data-retention, ZDR), mà sau đó trở thành yêu cầu tiêu chuẩn cho việc mua sắm của doanh nghiệp.

Nhưng hợp đồng chỉ khóa tài khoản công ty. IBM phát hiện rằng, đến năm 2025, AI bóng tối (nhân viên sử dụng tài khoản cá nhân để cung cấp dữ liệu công ty vào các công cụ AI không được phê duyệt) đã liên quan đến một phần năm các sự cố rò rỉ dữ liệu, trong khi việc sử dụng AI bóng tối nặng nề đã làm tăng chi phí rò rỉ trung bình thêm 670.000 USD. Trong một cuộc khảo sát năm 2025 của công ty đào tạo an ninh Anagram, bốn nhân viên cho biết họ sẵn sàng vi phạm chính sách sử dụng AI để hoàn thành nhiệm vụ nhanh hơn.

Doanh nghiệp ít nhất có thể chi tiền để mua lối thoát, hợp đồng ZDR, dịch vụ không huấn luyện, nếu bạn là khách hàng của chính phủ hoặc Palantir còn có triển khai chủ quyền. Còn đối với những người dùng bình thường như bạn và tôi, việc AI riêng tư có quan trọng hay không vẫn còn tranh cãi, cho đến khi giấy triệu tập của tòa án đến gõ cửa.

Một lệnh tòa vào tháng 5 năm 2025 đã buộc OpenAI phải lưu giữ cả những cuộc trò chuyện tiêu dùng mà người dùng đã xóa, và vào tháng 11, thẩm phán đã ra lệnh chuyển giao 20 triệu bản ghi đó cho luật sư của The New York Times như là tài liệu chứng cứ. Tiếp theo là các vụ án hình sự: hồ sơ ChatGPT của bị cáo trong vụ cháy Palisades đã trở thành chứng cứ, và một bản tuyên thệ trong vụ án hai xác ở Florida đã trích dẫn câu hỏi của nghi phạm về cách xử lý xác chết. Sam Altman cũng đã thừa nhận trong một cuộc phỏng vấn vào tháng 7 năm 2025 rằng, các cuộc trò chuyện ChatGPT không được bảo vệ bởi đặc quyền pháp lý, và trong các vụ kiện, OpenAI "có thể bị yêu cầu giao nộp" bản ghi trò chuyện của người dùng.

Điểm quan trọng không chỉ là tội phạm cần có cuộc trò chuyện riêng tư. Các cuộc trò chuyện giữa con người và AI được lưu trữ và có thể bị triệu tập, là một mảng giám sát mà hầu hết người dùng không biết đến. Luật Kolmogorov vào tháng 10 năm 2025 đã phát hiện ra trong một cuộc khảo sát 1.000 người dùng AI ở Mỹ rằng, 50% người không biết rằng những cuộc trò chuyện này có thể bị triệu tập, trong khi hai phần ba người cho rằng những cuộc trò chuyện này nên được bảo vệ như tư vấn với luật sư hoặc bác sĩ.

Các mô hình mã nguồn mở tự lưu trữ hoặc chạy trong môi trường có thể xác minh đang nhanh chóng đuổi kịp, nhưng nhóm mạnh nhất vẫn tụt lại khoảng 4 tháng so với các mô hình đóng nguồn tiên tiến. Điều này khiến các doanh nghiệp và cá nhân đang tối đa hóa token đứng trước ngã rẽ, hoặc từ bỏ vài tháng chất lượng mô hình vì sự riêng tư này, hoặc tiếp tục tải lên các tài liệu nhạy cảm lên máy chủ của Anthropic, vì đối thủ đang giành lợi thế năng suất theo cách này. Ngã tư của AI: Tại sao Phố Wall đang nói Hiện tại, trên thị trường không có giải pháp hoàn hảo, một báo cáo đã tổng hợp các nỗ lực của các bên để thu hẹp khoảng cách, quan sát khoảng cách giữa trí tuệ nhân tạo tiên tiến có thể chứng minh dưới sự riêng tư và việc giao hàng đến tay doanh nghiệp và người dùng bình thường còn xa đến đâu.

Hiện tại, làm thế nào để đạt được sự riêng tư

AI riêng tư không phải là một dự án đơn lẻ, nhưng hiện tại, mỗi cơ chế trên thị trường đều xử lý cùng một sự kiện: một prompt rời khỏi thiết bị của bạn, đi qua mạng, đến máy chạy mô hình, rồi trả về một phản hồi. Sự khác biệt giữa các cơ chế nằm ở chỗ văn bản rõ tồn tại ở đâu trên con đường này, ai có thể đọc nó ở đó, và dựa vào điều gì để xác minh tính riêng tư của phản hồi. Sự riêng tư ở cấp độ giao thức Ở cấp độ này, ngoài bạn ra còn có người khác đọc được prompt văn bản rõ của bạn, những gì xảy ra tiếp theo hoàn toàn phụ thuộc vào một lời hứa. Ngã tư của AI: Tại sao Phố Wall đang nói

  • Hợp đồng không lưu giữ là giải pháp dành cho doanh nghiệp. Nhà cung cấp biết bạn là ai, xử lý prompt của bạn và hứa không lưu giữ, thực hiện dựa vào hợp đồng và danh tiếng.

  • Đại lý ẩn danh xóa bỏ bạn là ai, nhưng không mã hóa những gì bạn đã nói, các nhà cung cấp dịch vụ hạ nguồn vẫn xử lý văn bản rõ theo chính sách của họ. Các điều khoản khác nhau giữa các nhà cung cấp, chẳng hạn như Duck.ai (sản phẩm chatbot của DuckDuckGo) sẽ thương lượng các thỏa thuận xóa bỏ với nhà cung cấp mô hình, trong khi Venice thì trực tiếp để người dùng giả định rằng nhà cung cấp sẽ lưu lại mọi thứ, nhưng cả hai bên đều không thể xác minh.

Mỗi đoạn đường giữa các máy đều chạy trên TLS, nó chỉ mã hóa đường ống, bên nhận thông tin có thể đọc tất cả thông tin. Các trung gian thường sử dụng Oblivious HTTP (RFC 9458) để tách quyền biết này ra, nguyên lý giống như nhờ bạn bè chuyển giấy. Bạn bè biết ai đã chuyển nhưng không thể đọc nội dung, người nhận có thể đọc nội dung nhưng không biết ai đã viết. OHTTP đã trở thành tiêu chuẩn IETF từ tháng 1 năm 2024, hiện đã có nhiều công ty chạy lưu lượng sản xuất trên các trung gian OHTTP thuê từ Cloudflare và Fastly.

Đây cũng là giới hạn về sự riêng tư mà bạn có thể nhận được khi truy cập các mô hình đóng nguồn, lý do là một bài toán số học. Chi phí cho một lần huấn luyện flagship hiện nay ở mức hàng tỷ đô la, trong khi định giá gần 1 nghìn tỷ đô la của các phòng thí nghiệm này dựa vào quyền sở hữu độc quyền của trọng số mô hình. Khoảng cách về khả năng mô hình kéo dài bao lâu, thì mức giá cao cũng kéo dài bấy lâu, vì vậy các phòng thí nghiệm coi các tệp trọng số như bí mật quốc gia.

Meta đã vô tình thực hiện thí nghiệm này. LLaMA được phát hành vào tháng 2 năm 2023 ban đầu chỉ mở cho các nhà nghiên cứu, nhưng chưa đầy một tuần, trọng số đã bị rò rỉ dưới dạng hạt giống lên 4chan. Một tuần sau, llama.cpp đã cho phép mô hình nhỏ nhất 7B chạy trả lời trên một chiếc MacBook, ba ngày sau, Stanford lại tinh chỉnh trợ lý trò chuyện Alpaca trên cùng một mô hình với chi phí chưa đến 600 USD. Sự rò rỉ này đã làm giảm chi phí vận hành của Llama xuống còn chi phí điện, bất kỳ ai có tệp đều có thể chạy tại nhà. Vào tháng 7 năm 2023, Meta chính thức mở mã Llama 2 với giấy phép thương mại loại trừ điều khoản 700 triệu người dùng hoạt động hàng tháng. Trọng số đã chạy, mức giá cao cũng theo đó mà chạy.

Các phòng thí nghiệm tiên tiến lý thuyết có thể thực hiện chứng thực cho suy diễn của các mô hình đóng nguồn, nhưng chứng thực chỉ có thể chứng minh đoạn mã nào đã đọc prompt, không thể chứng minh đoạn mã đó đã làm gì với nó. Để xác định xem máy chủ có lưu giữ dữ liệu hay không, chúng ta cần kiểm toán mã dịch vụ (serving code) và tái cấu trúc nó đến hàm băm mà phần cứng báo cáo. Nhưng một khi giao nộp mã dịch vụ, các phòng thí nghiệm cũng đã giao nộp các kỹ thuật xử lý hàng loạt và bộ nhớ hỗ trợ tỷ suất lợi nhuận, và những kỹ thuật này sẽ được chuyển giao cho mỗi thế hệ mô hình trong tương lai. Apple và Meta có thể thực hiện chứng thực từ xa cho các ngăn xếp dịch vụ đứng sau iPhone và WhatsApp vì lợi nhuận của họ đến từ thiết bị và quảng cáo, việc công khai mã dịch vụ gần như không tốn chi phí.

Đó là lý do tại sao trọng số của các mô hình flagship và mã dịch vụ không đến được tay các bên vận hành bên ngoài. Và không có bên vận hành bên ngoài, sẽ không có chứng thực bên thứ ba, không có chứng thực, thì sự riêng tư có thể xác minh chỉ tồn tại trên các mô hình mã nguồn mở. Sự riêng tư ở cấp độ cấu trúc Mỗi cơ chế trong loại này đều thay thế lời hứa bằng chứng dựa trên phần cứng, mật mã hoặc vật lý, nhưng mỗi loại đều phải trả giá khác nhau cho việc nâng cấp sự riêng tư, điều quan trọng nhất là chúng chỉ có thể chạy các mô hình mã nguồn mở. Ngã tư của AI: Tại sao Phố Wall đang nói

  • Tính toán bí mật trong TEE (Môi trường thực thi tin cậy) đưa suy diễn vào trong enclave phần cứng (một khoang kín trên chip mà ngay cả bên vận hành máy cũng không thể mở), chip sẽ ký một chứng thực, ghi rõ mô hình nào đã chạy, đoạn mã nào.

  • prompt chỉ bị khóa ở điểm đến. Trên con đường trung chuyển qua đại lý, vẫn có một vai trò có thể đọc văn bản rõ, và chỉ có giao thức mới ngăn chặn đại lý ghi lại hoặc rò rỉ nội dung trung chuyển.

  • E2EE (Mã hóa đầu cuối) đã khóa lại các trung gian có thể đọc. Thiết bị của người dùng sử dụng khóa của enclave để mã hóa prompt, mỗi bước trung gian mang theo một phong bì kín mà chỉ enclave mới có thể mở.

  • Niềm tin rơi vào phía khách hàng. Mã chịu trách nhiệm mã hóa prompt và xác minh chứng thực cũng có khả năng thu hồi đảm bảo này. Do đó, E2EE có thể xác minh vừa cần enclave đã được chứng minh, vừa cần mã khách hàng mở và có thể tái tạo.

  • So với sự đơn giản của TEE, chi phí của E2EE là gánh nặng kỹ thuật, điều này cũng làm chậm quá trình tích hợp tính năng. E2EE biến đại lý thành một người đưa thư mù, vì vậy tất cả các tính năng cần đọc văn bản rõ đều phải được xây dựng lại xung quanh khóa của khách hàng, hoặc chỉ được xây dựng lại bên trong enclave.

  • FHE (Mã hóa đồng nhất hoàn toàn, và biến thể MPC) hoàn toàn loại bỏ bên đáng tin cậy. Máy chủ thực hiện tính toán trên văn bản mã hóa trong một hộp khóa mà nó không bao giờ mở được, chìa khóa chỉ nằm trong tay bạn, MPC (tính toán an toàn nhiều bên) thì chia nhỏ prompt thành các phần bí mật phân phát cho nhiều bên, trừ khi tất cả các bên tham gia thông đồng, hiệu quả tương đương.

  • Chi phí là tốc độ. FHE nguyên bản chỉ thực hiện phép cộng và phép nhân, vì vậy các bước phi tuyến tính cần thiết cho hoạt động của transformer đều phải được tái tạo với chi phí cao. Chi phí suy diễn trên văn bản mã hóa là từ 10.000 đến 100.000 lần so với văn bản rõ, mỗi token trên mô hình nhỏ cũng cần vài giây đến vài phút, trong khi không mã hóa chỉ cần vài mili giây.

  • Các chip được thiết kế cho phép toán mã hóa có triển vọng thu hẹp khoảng cách, nhưng mẫu đầu tiên sẽ chỉ hoàn thành demo vào đầu năm 2026, phiên bản thương mại còn phải chờ vài năm nữa.

  • Suy diễn cục bộ hoàn toàn xóa bỏ con đường này. Mô hình chạy trên phần cứng của bạn, không có trung gian, không có máy chủ, không có nhà cung cấp dịch vụ, cũng không có yêu cầu xác minh.

  • Chi phí rõ ràng là chi phí và khả năng mô hình. gpt-oss-120b trên chỉ số Artificial Analysis đạt khoảng một nửa điểm số của GLM-5.2, nhưng kích thước 65GB, vượt quá tổng dung lượng bộ nhớ của hai card đồ họa flagship trên thị trường. Trong khi GLM-5.2 với độ chính xác đầy đủ chỉ có thể chạy trên 8 card trong trung tâm dữ liệu, chỉ riêng GPU đã tốn hơn 300.000 USD. Tuy nhiên, ngoài những hạn chế cấu trúc này, chi phí đưa suy diễn vào enclave đang giảm. Trong suy diễn trên một card, dịch vụ đám mây enclave Phala đã cho thấy, mất mát thông lượng của chế độ enclave trung bình chưa đến 7%, trong khi trên các mô hình lớn gần như bằng không, vì chi phí chính nằm ở việc chuyển dữ liệu vào chip, không phải ở việc tính toán bên trong. Trong suy diễn trên nhiều card, thế hệ GPU mới của NVIDIA Blackwell đã hỗ trợ mã hóa lưu lượng giữa các chip trực tiếp, trong khi H100 cũ phải đạt được hiệu quả tương tự chỉ bằng cách đi vòng qua CPU với băng thông chỉ bằng một phần bảy. Các bài kiểm tra chuẩn của NVIDIA trên Blackwell cho thấy, mô hình 397B trong chế độ enclave có mất mát thông lượng chưa đến 8%. Với những tiến bộ này, tổn thất hiệu suất của suy diễn riêng tư không còn là rào cản quyết định nữa.

Trên thực tế, enclave gần như không làm tăng chi phí vận hành cho bên cung cấp dịch vụ. Mỗi H100 sau năm 2023 đều đi kèm chế độ enclave, chi phí bổ sung là tổn thất thông lượng do mã hóa mang lại, chứ không phải là chip thêm vào. Hiện tại, giá thuê SKU H100 bí mật trên Azure vẫn là 8,90 USD mỗi giờ, trong khi không mở enclave là 6,98 USD, tương đương với việc tăng giá 27% trên cơ sở hạ tầng đám mây truyền thống. Ở phía bên kia, các nhà cung cấp như Phala chuyên cung cấp enclave, H100 trong chế độ bí mật đang được cho thuê với giá bắt đầu từ 3,80 USD mỗi giờ, thấp hơn so với khoảng giá 3,99 đến 4,29 USD của card SXM thông thường của Lambda. Trên các giải pháp API được quản lý, các điểm cuối có chứng thực của NEAR AI cung cấp gpt-oss-120b với giá 0,15 USD cho mỗi triệu token đầu vào và 0,55 USD cho đầu ra, ngang bằng với các tuyến đường văn bản rõ của Amazon Bedrock, Together và Groq. Ngay cả các mô hình cần nhiều chip song song, NEAR AI đã định giá trên GLM 5.2 không khác gì Fireworks, và trên Kimi K2.6 lớn hơn, đầu vào rẻ hơn 15%, đầu ra rẻ hơn 4%.

Mặc dù những nhà cung cấp dịch vụ suy diễn riêng tư mới này có thể đang đốt cháy lợi nhuận để giành thị phần (điều này cũng đúng với bất kỳ công ty nào muốn tăng trưởng trên thị trường), nhưng xu hướng cấu trúc là chi phí riêng tư đang giảm cho cả người tiêu dùng và bên cung cấp dịch vụ.

Các mô hình mã nguồn mở làm thế nào để chiến thắng?

Mặc dù chi phí hiệu suất đang giảm, vẫn còn một khoảng cách rõ rệt giữa các mô hình tiên tiến và các mô hình mã nguồn mở SOTA, một thực thể theo đuổi tối đa hóa năng suất muốn đứng ở hàng đầu, vẫn phải tin tưởng vào các phòng thí nghiệm tiên tiến không đánh cắp IP của mình.

Khoảng cách vẫn còn, nhưng AIA Labs thuộc Bridgewater và Thinking Machines đã đưa ra một trường hợp vào ngày 30 tháng 6: một mô hình mở được tinh chỉnh bằng cách gán nhãn chuyên gia đã đánh bại mô hình tiên tiến về độ chính xác và chi phí.

Trong nghiên cứu, nhóm đã tinh chỉnh Qwen3-235B trên Tinker (dịch vụ API tinh chỉnh được quản lý của Thinking Machines). Họ đã mua nhãn từ nhà cung cấp, sử dụng tập dữ liệu này để huấn luyện vòng đầu tiên, sau đó chuyển các mẫu khác biệt cho nhân viên đầu tư của công ty để gán nhãn lại. Việc huấn luyện sử dụng học tăng cường (GRPO), cộng thêm ba sửa đổi: phân nhóm theo vòng (các nhiệm vụ lần lượt đưa ra một lô), tổn thất CISPO (giới hạn mức tối đa mà một câu trả lời có thể kéo mô hình đi xa), tinh chế theo chính sách (neo vào checkpoint tối ưu hiện tại, đảm bảo mô hình không học từ các bản sao yếu hơn).

Tất cả các nhiệm vụ đều lấy từ quy trình làm việc hàng ngày của nhân viên đầu tư: một bài báo có quan trọng đối với các chuyên gia đầu tư cấp C-suite hay không, một tài liệu của ngân hàng trung ương có gợi ý về hướng thay đổi lãi suất trong tương lai hay không, một tài liệu hoặc một email có mẫu câu nào để bắt đầu. Điểm số đến từ tập kiểm tra độc lập, mô hình tiên tiến đạt điểm trung bình khoảng 50% dưới prompt đơn giản, với prompt chuyên gia cũng chỉ đạt 78,2%, thấp hơn ngưỡng 80% do nhân viên đầu tư đặt ra. Trong khi đó, Qwen đã được tinh chỉnh đạt 84,7%, theo cách diễn đạt ban đầu, điều này tương đương với việc ít mắc lỗi hơn 29,8% so với mô hình tiên tiến nhất, chi phí suy diễn thấp hơn 13,8 lần. Ngã tư của AI: Tại sao Phố Wall đang nói https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/ Trường hợp này chứng minh rằng các mô hình mã nguồn mở có thể chiến thắng về độ chính xác và chi phí, nhưng quá trình huấn luyện vẫn không phải là riêng tư. Nhãn chuyên gia được sử dụng trong quá trình này là dữ liệu riêng tư của Bridgewater, đi qua dịch vụ bên thứ ba Tinker, nằm trong cùng một cấp độ tin cậy với giao thức ZDR. Quỹ cũng đã thuê sức mạnh tính toán, toàn bộ quá trình huấn luyện diễn ra trên máy mà nó chưa bao giờ kiểm soát. Những người mua muốn có công thức này mà không muốn giả định niềm tin hiện nay có rất ít lựa chọn. Thuê cụm GPU trần, quá trình huấn luyện có thể đọc được đối với bên cung cấp dịch vụ đám mây. Mua cụm giải quyết vấn đề lưu trữ dữ liệu, nhưng chi phí sẽ tăng vọt.

Con đường có chứng thực vừa mới bắt đầu. Vào tháng 3, Workshop Labs và Tinfoil đã phát hành Silo, một bộ công cụ chạy trong enclave Tinfoil, trên một nút 8 card, chìa khóa chỉ do khách hàng kiểm soát. Bài viết đưa ra chi phí enclave là, hai giờ huấn luyện tốn thêm 11 phút, và bộ công cụ này thông qua việc đóng băng trọng số nền tảng, chỉ huấn luyện các adapter nhỏ, có thể chứa một mô hình một nghìn tỷ tham số (Kimi K2 Thinking). Thách thức nằm ở chỗ, học tăng cường cần di chuyển dữ liệu qua lại giữa các thành phần, trong khi việc di chuyển dữ liệu chính là chi phí của enclave.

Chưa đầy một tháng sau khi Silo được phát hành, Workshop Labs đã bị Thinking Machines mua lại, các thành phần cần thiết để chạy vòng RL kiểu Bridgewater trong enclave hiện đã thuộc về cùng một công ty.

Sự riêng tư ở cấp độ Harness

Còn một vấn đề khác nằm ngoài tất cả các cơ chế suy diễn riêng tư. Những cơ chế này quản lý con đường từ prompt đến mô hình, trong khi mỗi lần gọi công cụ bên ngoài do agent khởi xướng đều mở ra một con đường mà lớp suy diễn cơ bản không thể chạm tới. Xu hướng kỹ thuật harness gần đây đã phóng đại vấn đề, mỗi công cụ, kho nhớ và nguồn dữ liệu xung quanh mô hình đều là một điểm đến khác để đọc văn bản rõ cho phần công việc của mình. Máy chủ lịch đọc được lịch trình, máy chủ cơ sở dữ liệu đọc được truy vấn. Một agent hoàn toàn cục bộ nếu chỉ muốn bất kỳ thứ gì ngoài tập huấn luyện, vẫn cần gửi từ khóa dưới dạng văn bản rõ cho công cụ tìm kiếm, máy chủ không thể đọc văn bản rõ, không thể trả lời câu hỏi.

Giải pháp chính vẫn mặc định nằm ở cấp độ giao thức. Các công ty như Runlayer và MintMCP sử dụng một cổng trung tâm để kiểm soát toàn bộ lưu lượng công cụ, che giấu thông tin cá nhân (PII) trước khi yêu cầu ra ngoài. Cổng cũng quyết định máy chủ nào có thể nhận lưu lượng, chặn những cái không được kiểm tra bên ngoài, và ghi lại điểm đến và nội dung của mỗi lần gọi để phục vụ chứng cứ. Ngay cả khi những kiểm soát này có chứng thực độc lập (SOC 2), máy chủ công cụ vẫn phải đọc truy vấn văn bản rõ để trả lời, việc nó có lưu lại bản sao hay không phụ thuộc vào điều khoản lưu giữ của chính nó, và phải nhân lên với mỗi công cụ trong harness. Hơn nữa, cổng cũng là một bên đọc thêm phụ thuộc vào niềm tin trên con đường, chứ không phải là xác minh.

Giải pháp ở cấp độ cấu trúc đã chạm đến lớp giữa đó. Ví dụ, Phala đã trực tiếp lưu trữ máy chủ MCP vào TEE, thư mục bao gồm ví, thực thi mã và nguồn dữ liệu, người dùng có thể xác minh tuyên bố riêng tư bằng một chứng thực, thay vì tin tưởng vào bên cung cấp dịch vụ. Tuy nhiên, các công cụ được lưu trữ trong TEE cuối cùng vẫn phải gửi truy vấn dưới dạng văn bản rõ cho bên cung cấp dịch vụ, enclave chỉ khóa lại người đưa thư, không phải điểm đến. Ngã tư của AI: Tại sao Phố Wall đang nói Chỉ có một số ít điểm đến học được cách trả lời mà không cần đọc, nhưng chỉ giới hạn trong truy vấn có cấu trúc. Apple cung cấp tìm kiếm thông tin riêng tư cho iPhone, cho phép số điện thoại được so sánh với danh sách số điện thoại rác mà không cần tiết lộ số, Microsoft đã sử dụng cùng một giải pháp cho mật khẩu trong trình duyệt Edge. Mã hóa có thể truy vấn của MongoDB cho phép khách hàng mã hóa trước khi trường rời khỏi, máy chủ chỉ cần dựa vào văn bản mã hóa để hoàn thành so sánh giá trị và phạm vi.

Nhưng đối với tìm kiếm mở, câu trả lời tốt nhất hiện nay vẫn dừng lại ở niềm tin, tìm kiếm mã hóa có thể xác minh vẫn chưa ra khỏi phòng thí nghiệm. Brave đã cam kết không lưu giữ dữ liệu trên chỉ mục 400 tỷ trang của mình (không phải của Google), nhưng nó vẫn nằm ở cấp độ giao thức. Exa đã xây dựng một chỉ mục thần kinh, nhúng từ khóa của người dùng thành ngữ nghĩa, sắp xếp kết quả theo sự phù hợp ngữ nghĩa, nhưng bước nhúng này vẫn được tính toán trên máy chủ của Exa từ văn bản rõ. Bài báo Tiptoe của MIT năm 2023 đã hoàn thành việc sắp xếp trên 360 triệu trang web mà không tiết lộ truy vấn, nhưng mỗi lần tìm kiếm đều tiêu tốn một lượng lớn sức mạnh tính toán của máy chủ, chất lượng sắp xếp có sự khác biệt so với tìm kiếm không mã hóa. Bài báo Wally của Apple năm 2024 đã giảm chi phí truyền thông xuống tối đa 31 lần bằng cách giấu truy vấn thực trong một đống mồi nhử, nhưng toán học này chỉ trở nên rẻ khi có hàng triệu truy vấn đồng thời, và quy mô này, hiện không có bất kỳ hệ thống tìm kiếm riêng tư nào sở hữu.

Tìm kiếm mã hóa có thể thực hiện được, chỉ là hiệu suất và giá cả vẫn chưa đến mức khả thi thương mại.

Triển vọng

Nhu cầu về AI riêng tư đang tăng lên. Venice AI gần đây đã vượt qua 3,5 triệu người dùng đăng ký và 1,3 triệu tỷ token mỗi tháng, sau đó hoàn thành vòng tài trợ Series A trị giá 1 tỷ USD. Proton là đối thủ cạnh tranh trực tiếp của nó, sản phẩm trò chuyện Lumo của nó đã đạt 10 triệu người dùng trong vòng một năm. Về cơ sở hạ tầng, Phala hiện đang chạy từ 20 đến 30 tỷ token mỗi ngày trên OpenRouter. Duck.ai đã đưa gpt-oss-120b và Gemma vào enclave của Tinfoil, cung cấp sự riêng tư có thể xác minh ngoài đại lý cho người dùng. Điều này chưa tính đến tự lưu trữ, nó rất có thể là kênh lớn nhất cho suy diễn riêng tư, vì mô hình chạy trên phần cứng của chính mình, không để lại bất kỳ dấu vết sử dụng nào.

Tuy nhiên, trong làn sóng lớn của AI chính thống, AI riêng tư chỉ chiếm một phần rất nhỏ, và khoảng cách này chỉ thu hẹp khi các phòng thí nghiệm tiên tiến có ý định đáp ứng nhu cầu này. Vào tháng 5, Google đã xử lý 32.000 triệu tỷ token trên toàn bộ sản phẩm, tính theo đó, lưu lượng của Venice trong một tháng tương đương với 18 phút của Google. Vào tháng 11 năm ngoái, Google đã ra mắt Private AI Compute (PAC), đưa một số chức năng được điều khiển bởi Gemini vào chạy trong enclave TPU kín, cách ly với công ty của chính mình, và thiết kế được NCC Group kiểm toán độc lập. Nhưng vấn đề là, PAC chỉ bao phủ một số ít chức năng Pixel như gợi ý cá nhân hóa, tóm tắt ghi âm, không bao gồm hàng triệu người đang sử dụng ứng dụng Gemini. Google dám giao thiết kế cho bên kiểm toán vì những chức năng này kiếm tiền từ thiết bị và quảng cáo, không phải từ việc bán token.

Các giải pháp được quản lý hiện tại cũng không hoàn hảo. Những người dùng muốn có sự riêng tư cao nhất thông qua E2EE phải chờ đợi các tính năng mới được xây dựng lại ở những nơi mà bên cung cấp dịch vụ không thể đọc được. Harness riêng tư vẫn phụ thuộc vào giao thức ở cấp dịch vụ. Chi phí hợp lý cho việc huấn luyện sau vẫn cần tin tưởng vào các nhà cung cấp bên thứ ba để có được kết quả tinh chỉnh tốt nhất. Tự lưu trữ có thể loại bỏ tất cả các nhà cung cấp dịch vụ, nhưng để chạy mô hình mã nguồn mở mạnh nhất tại địa phương, số tiền có thể còn cao hơn cả ngôi nhà mà nó đang chạy trong đó.

Mặc dù có những thiếu sót, AI riêng tư đã trở thành một lựa chọn thực tế và có thể chi trả, và khoảng cách còn lại cũng đang thu hẹp. Đối với người tiêu dùng bình thường, trên Lumo và Venice, các mô hình mở với cam kết không ghi nhật ký có thể trò chuyện riêng tư mà không tốn một xu, trong khi đăng ký 18 đến 20 USD của Venice hoặc Tinfoil sẽ đóng gói cùng một cuộc trò chuyện trong enclave, không đắt hơn một đăng ký ChatGPT. Đối với quy trình làm việc của doanh nghiệp, các điểm cuối có chứng thực hiện nay thậm chí còn rẻ hơn so với các tuyến đường văn bản rõ. Các điểm cuối như API E2EE của NEAR đã có thể đưa ngữ cảnh mã hóa vào enclave, trí nhớ, tải tệp, và chỉ dẫn tùy chỉnh hiện có thể hoạt động trên E2EE. Còn về huấn luyện sau có chứng thực, NVIDIA sắp ra mắt Vera Rubin NVL72 sẽ mở rộng tính toán bí mật từ nút 8 card của Blackwell lên 72 card, làm cho vòng RL tiên tiến trở nên khả thi hơn mà không tiết lộ IP.

Tuy nhiên, việc nắm bắt giá trị quan trọng lại nằm ngoài những cấp độ giá cả này. Sự riêng tư gần như miễn phí ở những nơi đã tồn tại, nhưng vẫn chưa bao trùm quy trình làm việc agentic chính thống. Các nhà cung cấp dịch vụ chuyên về cho thuê enclave nắm giữ một công tắc trên chip tiêu chuẩn, không phải là một hào, trong khi cổng ở cấp độ giao thức lại cạnh tranh với các phần mềm trung gian truyền thống. Điểm phòng thủ là nửa còn lại trong báo cáo này chưa được giải quyết: các vòng huấn luyện bị khóa trong enclave, các cuộc gọi công cụ được đóng kín đầu cuối, các chỉ mục tìm kiếm không nhìn thấy. Ai là người đầu tiên làm được một trong những điều đó, sẽ bán được thứ mà bất kỳ cuộc chiến giá nào cũng không thể hàng hóa. Vốn đầu tư theo đuổi AI riêng tư nên mua khoảng trống, không phải cái công tắc đó.

Vậy, niềm tin hay xác minh? Đối với các nhiệm vụ trọng thực thi và trọng agent, chọn niềm tin, vì mỗi lần gọi công cụ đều đưa văn bản rõ đến điểm đến mà enclave không thể khóa lại, trong khi các mô hình tiên tiến xứng đáng với giá của chúng trong các vòng lặp như vậy. Còn đối với những suy nghĩ cấp cao phân biệt một công ty với đối thủ, chọn xác minh. Chiến lược, kế hoạch, và những phán đoán được tinh lọc từ nhiều năm kinh nghiệm chuyên môn chính là alpha đang gây tranh cãi. Con đường phía trước là trong ranh giới tự kiểm soát của công ty, sử dụng những hiểu biết độc quyền này để tinh chỉnh các mô hình mã nguồn mở. Trong lĩnh vực mà alpha của một công ty nằm, các mô hình mở được điều chỉnh bởi chuyên gia đã đánh bại các mô hình tiên tiến về độ chính xác và chi phí, và cơ sở hạ tầng để xây dựng nó trong môi trường riêng tư đang đến từng nút một.

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning Cảnh báo rủi ro
app_icon
ChainCatcher Building the Web3 world with innovations.