SpaceX присматривается к данным обанкротившихся стартапов ради обучения Grok

Обучение больших языковых моделей требует огромных массивов текста, а качественные данные стоят дорого. Судя по всему, постов в X и внутренних архивов SpaceX для Grok оказалось недостаточно, так как Илон Маск ищет более дешёвый источник.

По информации Bloomberg, SpaceX обсуждает покупку клиентских и операционных данных, оставшихся после испытывающих трудности или уже обанкротившихся стартапов.

Источники издания уточняют, что переговоры носят неформальный характер и вовсе могут не привести к сделке.

Потребность в дешёвых данных объясняется масштабом расходов. В первом отчёте о доходах, опубликованном в прошлом месяце, SpaceX заявила об обязательствах на 15,8 миллиарда долларов в области ИИ, при этом подразделение xAI закрыло квартал с чистым операционным убытком в 1,3 миллиарда долларов.

Маск рассчитывает, что Grok догонит модели конкурентов из OpenAI и Anthropic. До конца года ожидается презентация Grok 5, который, по утверждению предпринимателя, достигнет уровня общего искусственного интеллекта (AGI). Подобные заявления предполагают колоссальные объёмы обучающих выборок.

Если сделки всё же состоятся, у них будут серьёзные последствия для приватности. Любая компания, которой пользователь когда-то передал свои данные и которая сейчас испытывает финансовые проблемы, потенциально может перепродать этот архив.

SpaceX далеко не единственный игрок, охотящийся за подобными массивами. С распространением агентных ИИ-систем в корпоративной среде лаборатории всё выше ценят отраслевые знания, а продажа архивов рухнувших фирм превратилась в отдельный нишевый рынок.

Пример – аукцион по делу о банкротстве в прошлом месяце, где Google предложила 10 миллионов долларов за данные прекратившей существование авиакомпании Spirit Airlines. Материалы планируется использовать для обучения моделей Gemini.

Данные пассажиров в лот не вошли, зато вошёл внушительный корпоративный архив:

  • 100 миллионов корпоративных писем и 500 миллионов чатов в Microsoft Teams бывших сотрудников

  • сведения об эксплуатации самолётов, продуктивности персонала и 1 миллион записей табелей учёта рабочего времени

  • 17 миллионов персональных файлов в Microsoft OneDrive

  • сотни тысяч кадровых записей, включая налоговые формы, трудовые договоры и судебные материалы

Google заверила, что данные очистят от персонально идентифицирующей информации, но часть затронутых сторон это не устроило. Профсоюз бывших сотрудников Spirit, Ассоциация бортпроводников, подал возражение в суд по делам о банкротстве Южного округа Нью-Йорка.

Истцы указывают, что юридические стандарты процедуры деидентификации распространяются на потребителей, а приватные данные работников, включая записи о перелётах и налоговые формы, остаются уязвимыми.

Псевдонимизированный набор данных всё ещё может раскрыть, какие базы экипажей порождали жалобы, как небольшая группа бортпроводников проходила периодическое обучение, кто из сотрудников подвергался расследованиям, какие корректировки оплаты следовали за какими событиями и что сотрудники говорили друг другу о руководстве, укомплектовании штата или своём профсоюзе.

Суд по делам о банкротстве отложил утверждение сделки с Google.

Больше статей на Shazoo
Тэги:

Об авторе

Эксперт по Fallout
Главный редактор
Более 16 лет в индустрии освещения видеоигр, кино, сериалов, науки и техники. Особенно разбираюсь в серии Fallout, ценитель The Elder Scrolls. Поклонник Arcanum и Fallout Tactics. Больше всего играю в Civilization, Old World и градостроители. Изучаю ИИ и загадки космоса.