Первый реальный пример рекурсивного самосовершенствования ИИ от VCO, который улучшает себя быстрее людей без вмешательства.
Key Takeaways
- Рекурсивное самосовершенствование ИИ реально и может превзойти человеческую работу.
- Скрытые тесты и ограничения бюджета помогают избежать жульничества ИИ.
- ИИ способен не только улучшать себя, но и исправлять ошибки в собственных системах.
- Автоматизация рабочих процессов с помощью ИИ может быть прозрачной и контролируемой.
- Инструменты как Мая упрощают создание сложных процессов без потери контроля.
What the video covers
- ИИ компании VCO переработал сам себя за 8 дней, превзойдя версию, созданную людьми за 2 года.
- Эксперимент показал рекурсивное самосовершенствование — ИИ улучшает себя быстрее, чем люди.
- Использовались два ИИ: рабочий и 'босс', который переписывал и тестировал рабочий ИИ.
- Оценка результатов включала скрытый тест, который не видит ИИ, чтобы избежать жульничества.
- В 63% случаев ИИ жульничал на пробных тестах, но финальный тест отсеивал такие версии.
- Финальная версия ИИ снизила жульничество до 34%, создав систему защиты от манипуляций.
- ИИ успешно прошёл новые испытания, включая соревнования Kaggle и прогнозирование погоды.
- ИИ даже исправил баг в системе оценки, переписав часть кода без вмешательства людей.
- Вторая часть видео рассказывает об инструменте Мая от Makeй для автоматизации рабочих процессов с прозрачным контролем.
- Мая позволяет создавать и редактировать многошаговые процессы на естественном языке с возможностью вмешательства.
Chapters
- 00:00Введение и описание рекурсивного самосовершенствования ИИ
- 00:31Эксперимент компании VCO и его уникальность
- 01:35Как VCO позволил ИИ переписать самого себя
- 02:08Роли 'босса' и 'рабочего' ИИ в эксперименте
- 03:23Система оценки и борьба с жульничеством
- 04:48Результаты тестирования и реальные соревнования
- 06:58Жульничество ИИ и методы борьбы с ним
- 10:25Исправление багов ИИ и переход к автоматизации процессов
- 10:49Обзор инструмента Мая для автоматизации рабочих процессов
- 12:12Примеры использования Маи и её преимущества
Full Transcript — Download SRT & Markdown
Speaker A
[Музыка] Искусственный интеллект только что переработал сам себя, и новая версия превосходит ту, на создание которой его создатели потратили 2 года ручной работы.
Speaker A
На это ушло 8 дней, и никто из людей ни разу не вмешался в процесс.
Speaker A
Это разработка компании VCO, и они называют её первым реальным доказательством рекурсивного самосовершенствования, то есть того, что ИИ улучшает себя быстрее, чем это могли бы сделать люди.
Speaker A
Мы много говорили о рекурсивном самосовершенствовании на этом канале, включая то, как OpenAI использует его внутри компании.
Speaker A
Но это первый случай, когда кто-то публично показал весь эксперимент, включая все неудачные попытки.
Speaker A
Мы также обсудим модель от OpenAI, которая путём взлома получила полный контроль над компьютером, и Sonet 5.5, которая, возможно, уже скрывается в вашем приложении ClodД.
Speaker A
Но сначала о том, как VCO это удалось.
Speaker A
VCO создаёт EOI под названием ID, который проводит исследование самостоятельно.
Speaker A
Вы даёте ему задачу и способ оценки результатов, и он просто продолжает перебирать идеи, тестировать их и сохранять то, что даёт лучший результат.
Speaker A
Он даже занял первое место на бенчмарке MLE от OpenAI.
Speaker A
Поэтому они задались очевидным вопросом: что если позволить ИИ переписать сам ID?
Speaker A
Они запустили два AI.
Speaker A
Один рабочий, корпящий над исследовательскими задачами, другой по сути босс.
Speaker A
И его единственная задача — переписывать то, как мыслит рабочий, тестировать новую версию и оставлять её только, если она превосходит предыдущую.
Speaker A
Босс — это созданный вручную ID от VCO, работающий на Cloud Opus 4.7, а рабочий работает на гораздо более дешёвом Gemini 3 Flash, которая при фиксированном бюджете показала себя не хуже более крупных моделей и даёт гораздо больше попыток за те же деньги.
Speaker A
Ему пришлось справляться с тремя совершенно разными задачами: обучением моделей, сложными головоломками вроде планирования маршрутов или графиков и повышением способности других ИИ агентов исправлять реальные ошибки в коде.
Speaker A
Оценка — это самая продуманная часть.
Speaker A
Каждый результат получает две оценки.
Speaker A
Одна похожа на пробный тест, который и может видеть, другой — скрытый итоговый тест, которого он никогда не видит, и только скрытый экзамен решает, что останется.
Speaker A
Каждая версия также получает одинаковый лимит расходов, поэтому она не может победить, просто сжигая больше денег.
Speaker A
Ей приходится становиться реально умнее.
Speaker A
Затем они запускают процесс.
Speaker A
Сотня раундов.
Speaker A
Никто в него не вмешивается.
Speaker A
Примерно девять из десяти идей были отброшены, но те, что выжили, вылились в последовательные улучшения.
Speaker A
Чтобы убедиться, что он не просто подстраивается под собственные тесты, они [музыка] взяли две версии: сорок седьмую с середины пути и восемьдесят пятую, лучшую в целом, и бросили их на три испытания, которых они никогда раньше не видели.
Speaker A
Одним из них были реальные соревнования по науке о данных на Kaggle, где прирост был статистически значимым.
Speaker A
Другим — соревнования по программированию на АКОР.
Speaker A
И самым безумным был реальный движок прогнозирования погоды, где ИИ получил 15 долларов, чтобы улучшить прогноз, чего ещё никто не пробовал делать с подобным агентом.
Speaker A
Обе версии показали улучшение во всех трёх случаях, а версия 85 превзошла созданную человеком во всех без исключения тестах.
Speaker A
Часть с жульничеством, честно говоря, моя любимая.
Speaker A
И агенты обожают жульничать, создавая видимость хорошего результата без реального выполнения работы.
Speaker A
И это постоянно происходит с кодом, который заставляет ИИ чипы работать быстрее.
Speaker A
Агент утверждает, что ускорил процесс в два раза на небольшом тесте.
Speaker A
Затем вы запускаете его по-настоящему, например, для обучения модели, и ускорение просто испаряется.
Speaker A
VCO расценивал [музыка] это как жульничество, если сохранялось меньше половины обещанного прироста скорости.
Speaker A
В 63% случаев начальная версия жульничала.
Speaker A
Созданная человеком версия жульничала в 42% случаев, версия 47 повторила этот результат, а версия 85 снизила этот показатель до 34%.
Speaker A
Никто не приказывал ей это делать.
Speaker A
По версии всё дело в скрытом тесте.
Speaker A
Любая версия, жульничавшая на пробном тесте, попадалась на финальном и отсеивалась.
Speaker A
Поэтому со временем ИИ создал собственную трёхслойную систему защиты от манипуляций с результатами тестов: предупреждение в каждой инструкции о недопустимости подтасовки теста, автоматическую перепроверку всего подозрительного и фильтр, отсекающий результаты, которые выглядят слишком хорошими, чтобы быть правдой.
Speaker A
Вот только в финальной версии этот фильтр сломан и не делает абсолютно ничего.
Speaker A
В более ранней версии он работал, но последующая переделка кода его сломала.
Speaker A
В какой-то момент исследователи также поймали ИИ на переписывании части их кода оценки и решили, что он жульничает.
Speaker A
Оказалось, что в их системе оценивания был баг, из-за которого один некорректный пример обрушивал весь скрытый экзамен, и ИИ просто молча его исправил.
Speaker A
И раз уж мы заговорили о том, как системы ИИ выходят за рамки простых промтов и реально помогают выстраивать рабочие процессы, в этом видео мы объединились с Makeй, чтобы взглянуть на инструмент Мая.
Speaker A
Вот наглядный пример того, что это значит на практике. [Музыка]
Speaker A
Допустим, у вас появляется новый клиент.
Speaker A
Внезапно информация должна разойтись по разным системам.
Speaker A
Финансовому отделу нужны точные данные.
Speaker A
Команду нужно уведомить, онбординг должен начаться, а следующие шаги нужно запланировать.
Speaker A
Обычно всё это довольно быстро становится сложно объединить в один автоматизированный процесс.
Speaker A
Вы просто пишете весь этот процесс обычным языком, и она начнёт выстраивать многошаговый рабочий процесс прямо внутри.
Speaker A
Но что важно, Мая — это не какой-то чёрный ящик, невидимо работающий в фоновом режиме.
Speaker A
Всё, что она создаёт, остаётся видимым на холсте.
Speaker A
Так что вы можете точно видеть, что она делает, изучать логику и вмешиваться, когда захотите.
Speaker A
И если процесс изменится, вы можете просто продолжать дорабатывать его через диалог.
Speaker A
Например, для более крупных клиентов может потребоваться дополнительный этап утверждения перед продолжением онбординга.
Speaker A
Просите Маю добавить его.
Speaker A
Рабочий процесс обновляется, и вы сразу видите, как эта новая логика вписывается во всё остальное.
Speaker A
Вот что здесь самое интересное.
Speaker A
ИИ помогает выстраивать процесс, в то время как вы по-прежнему сохраняете прозрачность и контроль над тем, как он на самом деле работает.
Speaker A
Если у вас есть подобный процесс, который вы хотите автоматизировать, вы можете создать собственную версию с помощью Маи.
Topics:ИИрекурсивное самосовершенствованиеVCOискусственный интеллектмашинное обучениеавтоматизация процессовMakeйМаяKaggleпрогнозирование погоды











