BTC $79,422.50 -0.61%
ETH $2,490.76 -0.38%
BNB $744.08 -1.76%
XRP $1.40 -1.38%
SOL $104.91 -1.40%
TRX $0.3362 +0.37%
DOGE $0.0896 -0.22%
ADA $0.2196 -0.63%
BCH $256.20 -1.72%
LINK $13.18 +7.39%
HYPE $87.82 -0.45%
AAVE $133.66 -1.27%
SUI $0.8137 +1.73%
XLM $0.1913 +2.57%
ZEC $1,196.48 +2.41%
BTC $79,422.50 -0.61%
ETH $2,490.76 -0.38%
BNB $744.08 -1.76%
XRP $1.40 -1.38%
SOL $104.91 -1.40%
TRX $0.3362 +0.37%
DOGE $0.0896 -0.22%
ADA $0.2196 -0.63%
BCH $256.20 -1.72%
LINK $13.18 +7.39%
HYPE $87.82 -0.45%
AAVE $133.66 -1.27%
SUI $0.8137 +1.73%
XLM $0.1913 +2.57%
ZEC $1,196.48 +2.41%

Перекресток ИИ: почему Уолл-стрит говорит "нет" ChatGPT и Claude?

Ключевые тезисы
Summary: В области, где находится компания alpha, открытые модели, настроенные экспертами, уже одновременно превзошли передовые технологии по точности и стоимости, а инфраструктура для их создания в условиях конфиденциальности постепенно приходит, узел за узлом.
IOSG Венчуры
2026-07-13 22:47:22
В области, где находится компания alpha, открытые модели, настроенные экспертами, уже одновременно превзошли передовые технологии по точности и стоимости, а инфраструктура для их создания в условиях конфиденциальности постепенно приходит, узел за узлом.

Автор: Jeff @IOSG

Почему нужен частный ИИ

1 июля генеральный директор Palantir Алекс Карп в интервью на CNBC провел 20 минут, которые некоторые СМИ назвали "психическим срывом". По словам Карпа, компании платят токенную премию передовым лабораториям, в то время как их собственные IP-адреса направляются к моделям. Он назвал эту утечку переносом альфа, который происходит на уровне архитектуры: каждый запрос, отправленный к закрытым моделям, достигает серверов поставщика в открытом виде. За несколько дней до выхода программы Palantir только что объявила о сотрудничестве с NVIDIA, чтобы запускать открытые модели Nemotron в среде, контролируемой клиентами, и при этом представила девять пунктов декларации о суверенитете ИИ. После выхода программы акции PLTR подскочили на 8%. Перекресток ИИ: почему Уолл-стрит говорит В последние двадцать лет компании использовали облачное программное обеспечение на основе доверия на уровне протоколов, и это работало. Каждая компания SaaS видела лишь фрагменты корпоративных данных, и у большинства не было мотива использовать данные клиентов для улучшения своих основных продуктов. Salesforce видела каналы продаж, Workday видела кадровые данные, Jira видела итерации разработки, AWS предоставляла базу для хранения и вычислений. Однако сегодня рабочие процессы ИИ требуют однократной загрузки всех активов, включая структурированный контекст, связывающий различные отделы, для максимизации производительности. Оставив добрые намерения в стороне, поставщики услуг теперь могут использовать эти данные для создания новых функций, а не позволять им пылиться на серверах.

Никто не замедляется: годовая выручка Anthropic в мае достигла 47 миллиардов долларов, что значительно увеличилось по сравнению с 9 миллиардами долларов в конце 2025 года, а OpenAI в феврале преодолела 900 миллионов активных пользователей в неделю. Обе компании завершили новый раунд финансирования этой весной, их оценка приближается к 1 триллиону долларов, и ожидается, что они выйдут на IPO с более высокой капитализацией. Многолетние обвинения в нарушении конфиденциальности и прав интеллектуальной собственности не остановили обе компании.

Некоторые компании уже предприняли действия. В феврале 2023 года, менее чем через три месяца после выпуска ChatGPT, основные банки Уолл-стрит ограничили его использование. В мае 2023 года, после того как инженер Samsung утек в ChatGPT исходный код чипа, компания полностью запретила генеративный ИИ. В ответ OpenAI в августе того же года запустила ChatGPT Enterprise, пообещав не использовать коммерческие данные для обучения и добавив протокол нулевого хранения данных (zero-data-retention, ZDR), который с тех пор стал стандартным требованием для корпоративных закупок.

Но контракт лишь блокирует учетные записи компании. IBM обнаружила, что к 2025 году теневой ИИ (сотрудники, использующие личные учетные записи для передачи корпоративных данных в непроверенные ИИ-инструменты) был вовлечен в пятую часть случаев утечки данных, а интенсивное использование теневого ИИ увеличивало средние затраты на утечку на 670 тысяч долларов. В исследовании компании Anagram в 2025 году четверо сотрудников заявили, что готовы нарушить политику использования ИИ, чтобы быстрее выполнять задачи.

Компании могут потратить деньги на выход из ситуации, заключив контракты ZDR, не обучая сервисы, если вы являетесь клиентом правительства или Palantir, у вас есть возможность суверенного развертывания. А для таких обычных пользователей, как вы и я, важность конфиденциального ИИ до сих пор остается предметом споров, пока повестка не пришла к нам.

В мае 2025 года судебный приказ заставил OpenAI хранить даже удаленные пользователем чаты, а в ноябре судья приказал передать 20 миллионов записей адвокатам The New York Times в качестве доказательств. Затем последовали уголовные дела: записи ChatGPT обвиняемого в поджоге Пэлисейдс стали доказательством, а в клятве по делу о двойном убийстве во Флориде были процитированы вопросы подозреваемого о том, как расправиться с телами. Сэм Альтман также признал в интервью в июле 2025 года, что диалоги ChatGPT не защищены юридическим привилегией, и в судебных разбирательствах OpenAI "может быть вынуждена предоставить" записи чатов пользователей.

Суть не в том, что только преступники нуждаются в конфиденциальных разговорах. Диалоги людей и ИИ фиксируются и могут быть вызваны в суд, что является аспектом наблюдения, о котором большинство пользователей не знает. Закон Колмогорова в октябре 2025 года в опросе 1000 американских пользователей ИИ обнаружил, что 50% людей не знали, что эти разговоры могут быть вызваны в суд, в то время как две трети считали, что эти чаты должны получать такую же защиту, как консультации с юристом или врачом.

Самостоятельно размещенные или работающие в проверяемой среде открытые модели быстро догоняют, но самые сильные из них все еще отстают от передовых закрытых моделей примерно на 4 месяца по общим возможностям. Это ставит компании и частных лиц, занимающихся токенмаксингом, на распутье: либо отказаться от нескольких месяцев качества модели ради этой конфиденциальности, либо продолжать загружать чувствительные материалы на серверы Anthropic, поскольку конкуренты именно так и захватывают преимущества производительности. Перекресток ИИ: почему Уолл-стрит говорит В настоящее время на рынке нет идеального решения, и отчет обобщает попытки различных сторон сократить разрыв, наблюдая, насколько близко передовой интеллект под проверяемой конфиденциальностью к доставке компаниям и обычным пользователям.

Как реализуется конфиденциальность в настоящее время

Конфиденциальный ИИ не является единым проектом, но в настоящее время каждая механика на рынке обрабатывает одно и то же событие: запрос покидает ваше устройство, проходит через сеть, попадает на машину, выполняющую модель, а затем возвращает ответ. Различия между механизмами заключаются в том, где в этом пути существует открытый текст, кто может его прочитать и на чем основана проверка конфиденциальности ответа. Конфиденциальность на уровне протокола На этом уровне кроме вас есть еще кто-то, кто читает ваш открытый текст запроса, и что происходит дальше, зависит от одного обещания. Перекресток ИИ: почему Уолл-стрит говорит

  • Контрактное нулевое хранение — это корпоративное решение. Поставщик знает, кто вы, обрабатывает ваш запрос и обещает не хранить его, выполняя это на основе контракта и репутации.

  • Анонимный прокси стирает, кто вы, но не шифрует, что вы сказали, и нижестоящие поставщики все равно обрабатывают открытый текст в соответствии со своей политикой. Условия различаются, например, такие прокси, как Duck.ai (продукт чат-бота DuckDuckGo), будут обсуждать с поставщиком модели соглашение о удалении, в то время как Venice просто предполагает, что пользователи должны считать, что поставщик сохранит все, но обе стороны не могут это проверить.

Каждый сегмент пути между машинами работает по TLS, который просто шифрует канал, и принимающая сторона может прочитать всю информацию. Ретрансляторы обычно используют Oblivious HTTP (RFC 9458), чтобы разделить это право на информацию, принцип похож на передачу записки через друга. Друг знает, кто передал, но не может прочитать содержание, получатель может прочитать содержание, но не знает, кто написал. OHTTP стал стандартом IETF с января 2024 года, и в настоящее время многие компании запускают производственный трафик через OHTTP-ретрансляторы, арендуемые у Cloudflare и Fastly.

Это также предел конфиденциальности, который можно получить при доступе к закрытым моделям, причина в арифметической задаче. Стоимость одной флагманской тренировки сейчас составляет миллиарды долларов, а оценка этих лабораторий в триллионы долларов основана на эксклюзивности весов модели. Насколько долго будет разрыв в возможностях модели, настолько долго будет сохраняться премия, поэтому лаборатории охраняют файлы весов как государственную тайну.

Meta уже пассивно провела этот эксперимент. В феврале 2023 года LLaMA была открыта только для исследователей, но менее чем через неделю веса были утечены в виде семян на 4chan. Еще через неделю llama.cpp позволила запустить самую маленькую модель 7B на MacBook, а через три дня Стэнфорд снова использовал ту же модель для создания чат-ассистента Alpaca за менее чем 600 долларов. Эта утечка снизила стоимость запуска Llama до стоимости электроэнергии, и любой, кто получил файл, мог запустить его дома. В июле 2023 года Meta официально открыла Llama 2 с коммерческой лицензией, исключающей 700 миллионов активных пользователей. Веса ушли, и премия ушла вместе с ними.

Передовые лаборатории теоретически могут проводить аттестацию (удаленное подтверждение) для вывода закрытых моделей, но аттестация может только подтвердить, какой код прочитал запрос, но не может подтвердить, что этот код с ним сделал. Чтобы выяснить, сохраняет ли сервер данные, нам нужно провести аудит кода обслуживания (serving code) и реконструировать его до того хэша, который сообщает оборудование. Но как только код обслуживания будет передан, лаборатория также передаст свои методы пакетной обработки и кэширования, которые будут перенесены на каждое следующее поколение моделей. Apple и Meta могут проводить удаленное подтверждение для сервисного стека, стоящего за iPhone и WhatsApp, потому что их прибыль находится в устройствах и рекламе, а публикация кода обслуживания почти не требует затрат.

Вот почему веса флагманских моделей и код обслуживания не могут попасть к внешним операторам. А без внешних операторов нет третьей стороны для аттестации, и без аттестации проверяемая конфиденциальность существует только в открытых моделях. Конфиденциальность на уровне структуры Каждый механизм в этой категории заменяет доверительные обязательства на доказательства, основанные на аппаратном обеспечении, криптографии или физике, но каждый из них должен заплатить разную цену за обновление конфиденциальности, прежде всего тем, что они могут работать только с открытыми моделями. Перекресток ИИ: почему Уолл-стрит говорит

  • Конфиденциальные вычисления в TEE (доверенной исполняемой среде) помещают вывод в аппаратный enclave (герметичная камера на чипе, которую даже оператор машины не может открыть), и чип подписывает аттестацию, указывая, какая именно модель и какой код были запущены.

  • Запрос закрывается только в конечной точке. На пути, проходящем через прокси, все еще есть роль, которая может читать открытый текст, а единственным способом предотвратить запись или утечку промежуточного содержимого является протокол.

  • E2EE (сквозное шифрование) закрывает читаемые ретрансляторы. Устройство пользователя шифрует запрос с помощью ключа enclave, и на каждом промежуточном этапе передается только запечатанное письмо, которое может быть открыто только enclave.

  • Доверие ложится на клиент. Код, ответственный за шифрование запроса и проверку аттестации, также имеет возможность отменить это обещание. Таким образом, проверяемое E2EE требует как доказанного enclave, так и открытого, воспроизводимого клиентского кода.

  • По сравнению с простотой TEE, цена E2EE — это инженерная нагрузка, что также замедляет интеграцию функций. E2EE превращает прокси в слепого курьера, поэтому все функции, которые должны работать с открытым текстом, должны быть перестроены вокруг клиентского ключа или только внутри enclave.

  • FHE (гомоморфное шифрование и его варианты MPC) полностью устраняют доверенную сторону. Сервер выполняет вычисления над зашифрованными данными в запертом ящике, ключ остается только у вас, а MPC (многопартнерские безопасные вычисления) разбивает запрос на секретные доли, которые распределяются между несколькими сторонами, и только если все участники сговорятся, эффект будет равен.

  • Цена — это скорость. FHE изначально может выполнять только сложение и умножение, поэтому нелинейные шаги, необходимые для работы трансформеров, должны быть восстановлены с высокими затратами. Стоимость вывода на зашифрованных данных составляет от 10 000 до 100 000 раз больше, чем на открытых, и для небольших моделей каждый токен может занимать от нескольких секунд до нескольких минут, в то время как в незашифрованном виде это занимает миллисекунды.

  • Чипы, специально разработанные для шифрования, могут сократить разрыв, но первый прототип будет готов только в начале 2026 года, а коммерческие версии придется ждать еще несколько лет.

  • Локальный вывод полностью устраняет этот путь. Модель работает на вашем собственном оборудовании, без ретрансляторов, без серверов, без поставщиков услуг и без требований к верификации.

  • Очевидная цена — это стоимость и возможности модели. gpt-oss-120b получает около половины баллов по индексу Artificial Analysis по сравнению с GLM-5.2, но его размер составляет 65 ГБ, что превышает объем видеопамяти двух флагманских игровых видеокарт на рынке. В то время как полная версия GLM-5.2 может работать только на 8-картных узлах в дата-центре, стоимость только GPU составляет более 300 000 долларов. Тем не менее, за пределами этих структурных ограничений стоимость вывода в enclave продолжает сокращаться. В тестах производительности облачного провайдера enclave Phala показали, что потеря производительности в режиме enclave для одной карты H100 составляет в среднем менее 7%, а для больших моделей — почти ноль, потому что основные затраты связаны с перемещением данных в чип, а не с вычислениями внутри. В многокартном выводе новое поколение GPU NVIDIA Blackwell уже поддерживает прямое шифрование трафика между чипами, в то время как старый H100 для достижения того же эффекта может использовать только одну седьмую пропускной способности, обходя центральный процессор. Тесты NVIDIA на Blackwell показывают, что потеря производительности для модели 397B в режиме enclave составляет менее 8%. С этими достижениями производительность конфиденциального вывода больше не является решающим ограничением.

На самом деле, сам enclave почти не увеличивает дополнительные эксплуатационные расходы для операторов. Каждая H100, выпущенная после 2023 года, уже имеет режим enclave, а дополнительные затраты связаны с потерей производительности от шифрования, а не с дополнительными чипами. В настоящее время аренда конфиденциальной H100 SKU на Azure составляет 8,90 долларов в час, а без режима enclave — 6,98 долларов, что эквивалентно увеличению на 27% по сравнению с традиционными облачными услугами. С другой стороны, у таких операторов, как Phala, которые специально предоставляют enclave, конфиденциальный режим H100 арендуется по цене от 3,80 долларов в час, что ниже диапазона цен обычных карт Lambda от 3,99 до 4,29 долларов. В рамках решения API, NEAR AI предлагает конечные точки с аттестацией по цене 0,15 долларов за миллион токенов на ввод и 0,55 долларов на вывод для gpt-oss-120b, что соответствует ценам на открытых маршрутах Amazon Bedrock, Together и Groq. Даже для моделей, требующих параллельной работы нескольких чипов, NEAR AI устанавливает цены на GLM 5.2 на уровне Fireworks и предлагает более низкие цены на ввод на 15% и на вывод на 4% для более крупной модели Kimi K2.6.

Хотя эти новые провайдеры конфиденциального вывода могут сжигать прибыль, чтобы захватить долю рынка (это утверждение применимо ко всем компаниям, стремящимся к росту), структурная тенденция такова, что стоимость конфиденциальности снижается как для потребителей, так и для операторов.

Как открытые модели могут победить?

Несмотря на то, что производственные затраты снижаются, все еще существует заметный разрыв между передовыми моделями и SOTA открытыми моделями, и субъект, стремящийся к максимизации производительности, все еще должен доверять передовым лабораториям, чтобы они не украли свои IP.

Разрыв все еще существует, но AIA Labs под управлением Bridgewater и Thinking Machines 30 июня представили пример: открытая модель, настроенная с помощью экспертной разметки, одновременно превзошла передовую модель как по точности, так и по стоимости.

В исследовании команда настроила Qwen3-235B на Tinker (API-сервис по настройке от Thinking Machines). Они сначала закупили разметку у поставщика, использовали эти данные для первого раунда обучения, а затем передали образцы с разногласиями инвестиционным специалистам компании для повторной разметки. Обучение проводилось с использованием обучения с подкреплением (GRPO) с тремя изменениями: раундовая пакетная обработка (каждая задача по очереди представляет один пакет), ограничение потерь CISPO (ограничение на то, насколько далеко один ответ может повлиять на модель) и дистилляция на основе политики (закрепление текущей оптимальной контрольной точки, чтобы гарантировать, что модель не будет учиться на более слабых копиях).

Все задачи были взяты из повседневного рабочего процесса инвестиционных специалистов: важна ли новость для инвестиционных профессионалов уровня C-suite, указывает ли документ центрального банка на направление будущих изменений процентных ставок, откуда начинается шаблон в документе или письме. Оценка проводилась на основе независимого тестового набора, передовая модель в простых запросах в среднем набирала около 50%, а с экспертными запросами достигала только 78,2%, что ниже установленного инвестиционными специалистами порога в 80%. Настроенная Qwen набрала 84,7%, что, по словам авторов, соответствует снижению ошибок на 29,8% по сравнению с передовыми оптимальными моделями и снижению затрат на вывод на 13,8 раз. Перекресток ИИ: почему Уолл-стрит говорит https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/ Этот случай доказывает, что открытые модели могут победить по точности и стоимости, но процесс обучения все еще не является частным. Экспертная разметка, использованная в процессе, является частными данными Bridgewater и проходит через сторонний сервис Tinker, попадая на тот же уровень доверия, что и протокол ZDR. Фонд также арендовал вычислительные мощности, и все обучение проходило на машинах, которые он никогда не контролировал. У покупателей, желающих получить этот рецепт, не желая полагаться на доверительные предположения, сегодня остается очень мало вариантов. Аренда голых кластеров GPU делает процесс обучения доступным для облачных операторов. Покупка кластера решает проблему хранения данных, но стоимость взлетает до небес.

Маршрут с аттестацией только начинает развиваться. В марте Workshop Labs и Tinfoil выпустили Silo, стек постобучения, работающий в enclave Tinfoil на одном 8-картном узле, ключ от которого находится только у клиента. В статье указана стоимость enclave: два часа обучения требуют дополнительных 11 минут, и этот стек может вместить триллионную модель параметров (Kimi K2 Thinking), замораживая базовые веса и обучая только небольшие адаптеры. Сложность заключается в том, что обучение с подкреплением требует перемещения данных между компонентами, а перемещение данных является основной статьей затрат enclave.

Менее чем через месяц после выпуска Silo Workshop Labs была приобретена Thinking Machines, и теперь все компоненты, необходимые для запуска следующего цикла RL в стиле Bridgewater в enclave, находятся под одной крышей.

Конфиденциальность на уровне Harness

Существует еще одна проблема, которая стоит вне всех механизмов частного вывода. Эти механизмы управляют путем от запроса к модели, а каждый вызов внешнего инструмента, инициированный агентом, открывает путь, который не может быть затронут на уровне вывода. Недавняя волна harness engineering значительно увеличила проблему: каждый инструмент, хранилище и источник данных, окружающие модель, являются еще одной целью, которая считывает свою часть рабочего процесса в открытом виде. Сервер календаря считывает расписание, сервер базы данных считывает запрос. Полностью локальный агент, если ему нужно что-то вне обучающего набора, все равно должен передать поисковый запрос в открытом виде поисковой системе, сервер не может прочитать открытый текст и не сможет ответить на вопрос.

Основное решение по-прежнему предполагает уровень протокола. Компании, такие как Runlayer и MintMCP, используют центральный шлюз для управления всем трафиком инструментов, скрывая личные данные (PII) перед выходом запросов. Шлюз также определяет, какие серверы могут получать трафик, блокируя непроверенные, и записывает цель и содержание каждого вызова для последующего аудита. Даже если эти меры контроля имеют независимый аудит (SOC 2), серверы инструментов все равно должны читать открытые текстовые запросы, чтобы ответить, и сохранять ли они копию, зависит от их собственных условий хранения, а также от каждого инструмента в harness. Кроме того, сам шлюз является дополнительной зависимой стороной, читающей информацию на пути, а не проверяющей.

Структурные решения затрагивают промежуточный уровень. Например, Phala напрямую размещает сервер MCP в TEE, каталог охватывает кошельки, выполнение кода и источники данных, пользователи могут проверить заявление о конфиденциальности с помощью аттестации, а не полагаясь на оператора. Однако инструменты, размещенные в TEE, все равно должны передавать запросы в открытом виде поставщику услуг, enclave закрывает только курьера, а не конечный пункт. Перекресток ИИ: почему Уолл-стрит говорит Только несколько конечных пунктов научились отвечать, не читая, но только для структурированных запросов. Apple предоставляет частный поиск информации для iPhone, позволяя сопоставлять номера звонков с базой данных спам-звонков без раскрытия номера, Microsoft использует ту же схему для паролей в браузере Edge. MongoDB с помощью Queryable Encryption позволяет клиенту шифровать данные перед их отправкой, сервер может выполнять операции равенства и диапазона только на основе зашифрованных данных.

Но для открытого поиска сегодня лучшие ответы основаны на доверии, проверяемый зашифрованный поиск еще не вышел из лаборатории. Brave обещает нулевое хранение данных на своем собственном индексе из 400 миллиардов страниц (в отличие от Google), но все еще остается на уровне протокола. Exa построила нейронный индекс, который встраивает ключевые слова пользователей в семантику и сортирует результаты на основе семантического соответствия, но этот этап встраивания все еще происходит на серверах Exa, начиная с открытого текста. В статье MIT 2023 года Tiptoe сортировка была выполнена на 360 миллионах веб-страниц без раскрытия запросов, но каждый поиск требует значительных вычислительных ресурсов сервера, и качество сортировки отличается от незашифрованного поиска. Статья Apple 2024 года Wally скрывает реальные запросы среди множества приманок, что позволяет снизить стоимость связи до 31 раз, но эта математическая модель становится дешевой только при миллионах параллельных запросов, а такого масштаба сегодня нет ни у одной частной поисковой системы.

Зашифрованный поиск возможен, просто производительность и цена еще не достигли коммерчески жизнеспособного уровня.

Перспективы

Спрос на частный ИИ растет. Venice AI недавно преодолела 3,5 миллиона зарегистрированных пользователей и 1,3 триллиона токенов в месяц, после чего завершила новый раунд финансирования Series A с оценкой 1 миллиард долларов. Proton является ее прямым конкурентом, его чат-продукт Lumo за год работы привлек более 10 миллионов пользователей. В инфраструктуре Phala в настоящее время ежедневно обрабатывает от 20 до 30 миллиардов токенов на OpenRouter. Duck.ai направляет gpt-oss-120b и Gemma в enclave Tinfoil, предоставляя пользователям проверяемую конфиденциальность помимо прокси. Это еще не учитывает самоуправление, которое, вероятно, станет крупнейшим каналом для частного вывода, поскольку модели работают на вашем собственном оборудовании, не оставляя никаких следов использования.

Тем не менее, в контексте общего потока ИИ конфиденциальный ИИ занимает лишь крошечную долю, и этот разрыв может сократиться только тогда, когда передовые лаборатории намеренно удовлетворят этот спрос. В мае Google обработала 32 триллиона токенов во всех своих продуктах, исходя из этого, месячный объем Venice примерно равен 18 минутам работы Google. В ноябре прошлого года Google запустила Private AI Compute (PAC), чтобы запустить некоторые функции на основе Gemini в изолированном TPU enclave, и проект был разработан с независимым аудитом от NCC Group. Но проблема в том, что PAC охватывает лишь несколько функций Pixel, таких как персонализированные рекомендации и резюме записей, и не охватывает миллионы пользователей Gemini. Google может позволить себе передать проект на аудит, потому что эти функции монетизируются через устройства и рекламу, а не через продажу токенов.

Текущие решения по размещению также не идеальны. Чтобы получить максимальную конфиденциальность через E2EE, пользователям придется дождаться, пока новые функции будут заново построены в местах, недоступных для поставщиков услуг. Частный harness по-прежнему зависит от протокола на уровне сервиса. Доступные по цене постобучения требуют доверия к сторонним поставщикам для достижения наилучших результатов настройки. Самостоятельное размещение полностью устраняет всех поставщиков услуг, но запуск самой мощной открытой модели на локальном оборудовании может стоить дороже, чем дом, в котором она находится.

Недостатки остаются, но частный ИИ уже является реальным и доступным вариантом, а оставшийся разрыв сужается. Для обычных потребителей на Lumo и Venice открытые модели с обещанием отсутствия логов обеспечивают конфиденциальный чат без каких-либо затрат, подписка на Venice или Tinfoil стоит от 18 до 20 долларов и закрывает тот же чат в enclave, что не дороже подписки на ChatGPT. Для рабочих процессов компаний конечные точки с аттестацией теперь даже дешевле, чем открытые маршруты. Конечные точки, такие как E2EE API от NEAR, уже могут переносить зашифрованный контекст в enclave, и память, загрузка файлов и настраиваемые команды могут работать на E2EE. Что касается постобучения с аттестацией, NVIDIA вскоре выпустит Vera Rubin NVL72, который расширит конфиденциальные вычисления с 8-картных узлов Blackwell до 72-картных стоек, что сделает передние RL-циклы более жизнеспособными без раскрытия IP.

Тем не менее, ключевое создание ценности происходит за пределами этих уровней ценового сжатия. Конфиденциальность почти бесплатна там, где она уже существует, но еще не охватывает основные агентные рабочие процессы. Операторы, сосредоточенные на аренде и продаже enclave, держат переключатель на стандартных чипах, а не защитную стену, в то время как шлюзы на уровне протокола конкурируют с традиционными промежуточными решениями. Защищенные позиции — это та половина, которая еще не была решена в этом отчете: тренировочные циклы, закрытые в enclave, вызовы инструментов, полностью закрытые от конца до конца, и невидимые поисковые индексы. Кто первым реализует одну из этих задач, тот продаст то, что невозможно будет коммерциализировать в ценовых войнах. Капитал, стремящийся к конфиденциальному ИИ, должен инвестировать в разрыв, а не в этот переключатель.

Так что, доверять или проверять? Для задач, требующих высокой степени исполнения и агентности, выбирайте доверие, потому что каждый вызов инструмента уже передает открытый текст в конечный пункт, который enclave не может закрыть, и передовые модели в таких циклах оправдывают свою цену. Что касается высокоуровневого мышления, которое отличает компанию от конкурентов, выбирайте проверку. Стратегия, планирование и суждения, выведенные из многолетнего опыта, как раз и составляют ту самую альфу, которая вызывает споры. Дорога вперед — это использование этих уникальных инсайтов для настройки открытых моделей в пределах границ, контролируемых компанией. В области, где находится альфа компании, открытые модели, настроенные экспертами, уже одновременно превзошли передовые модели по точности и стоимости, а инфраструктура для их создания в условиях конфиденциальности постепенно приходит, узел за узлом.

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning Предупреждение о рисках
app_icon
ChainCatcher Building the Web3 world with innovations.