Огляд GPT6 Astra як потенційного AGI, розв’язок задачі Вєстокса 10 000 AI агентами та новинки від Google і OpenAI у сфері AI.
Key Takeaways
- GPT6 Astra демонструє великий прорив у продуктивності та можливостях AI.
- Використання тисяч AI агентів для розв’язання складних наукових задач відкриває нові горизонти у науці.
- Нові моделі від Google і OpenAI значно покращують роботу з кодом, зображеннями та мультимодальністю.
- Розв’язок задачі Вєстокса ще потребує незалежної перевірки, але це вже значний крок уперед.
- Швидкість розвитку AI змінює уявлення про темпи інновацій у цій сфері.
What the video covers
- Представлено GPT6 Astra, яку називають AGI, з великим стрибком у продуктивності та новими можливостями.
- OpenAI вирішила одну із задач тисячоліття — задачу Вєстокса, використовуючи 10 000 AI агентів, які працювали паралельно.
- Обговорено потенціал моделі Astra у кодингу, економіці, біології та іграх, а також її приховані ланцюжки міркувань.
- Підкреслено новий підхід до наукової роботи з використанням великої кількості AI агентів як цифрової лабораторії.
- Розглянуто нові моделі від Google (GMI Flash mini 3.8) з покращеннями у кодуванні та агентах.
- OpenAI оновила модель для генерації та редагування зображень Chat JBT Images 2.5 із значним покращенням якості та швидкості.
- Fable 5.1 розшифрувала історичний шифр, який не могли розгадати понад 370 років.
- Оголошено про конференцію Вавтек у Варшаві з участю провідних IT-компаній і спікерів.
- Обговорено питання безпеки та прозорості моделей, зокрема прихованих процесів міркувань Astra.
- Підкреслено швидкість розвитку AI і сумнів у тезі про повільний розвиток (slow takeoff).
Chapters
- 00:00Вступ та анонс конференції Вавтек
- 01:23Огляд GPT6 Astra та її можливості
- 02:23Розв’язок задачі Вєстокса 10 000 AI агентами
- 05:48Новий підхід до наукових досліджень з AI
- 06:28Розшифрування історичних шифрів моделлю Fable 5.1
- 07:28Огляд нових моделей Google GMI Flash mini 3.8
- 08:35Оновлення OpenAI для генерації та редагування зображень
Full Transcript — Download SRT & Markdown
Speaker A
Всім привіт. Це вже четвертий випуск шоу АІ шумлянь. І сьогодні новин реально багато. Поговоримо про GPT6 Astra, яку вже називають AGI, і про те, як 10 000 агентів взялись за одну із задач тисячоліття. Подивимось на нові моделі від Google, Open AI, Tencent і Black Forest Lab, які вже генерують і редагують код, картинки, відео та аудіо. Ну, як завжди, я назбирав купу маленьких AI інструментів, які можна відкрити після цього відео і одразу спробувати самостійно. Хороше AI новин за два тижні назбиралось достатньо, тому погнали розгрібати. А спершу невеликий анонс. 26-27 листопада у Варшаві пройде Вавтек. Велика конференція від DO на 3 000 айтівців. Більше 60 спікерів із Netflix, Microsoft, Google, Dropbox and Desk, Allegro, Agoba та інших компаній. Плюс Jobs speedting, воркшопи і after авторпаті. Коротше, два дні повного IT-двіжу. Тому, якщо будете у Варшаві, заходьте. А тепер погнали скоріше до AI новин.
Speaker A
Починаємо з головної новини GPT6 Astra. І реакція на неї доволі гучна. Брок пише: "Welcome to AI." Jensen теж вітає команду Open AI зі створенням AGI. Чи це насправді? Залишимо це питання відкритим, але давайте подивимось, що показали. Перше — бенчмаркет. Якщо опубліковані результати відповідають реальності, стрибок просто величезний. Я, чесно кажучи, не пам'ятаю настільки великого скачка в бенчмарках при виході однієї моделі. При цьому коштує Astra приблизно стільки ж, скільки і Fable.
Speaker A
Друге. Подивіться на проекти, які зробили люди з раннім доступом до моделі. Причому цей ранній доступ він давався всього лиш на тиждень. Ігри вона, до речі, робить теж дуже непогані.
Speaker A
Але Astra — це не тільки про ігри або про 3D. За опублікованими результатами її приріст у кодингу та економічних задачах, особливо біології, ще більше.
Speaker A
Прошу на візуальних прикладах показати її результати набагато простіше. Що це означає для продуктів, які можна отримати кодом? Я бачу це так. Якщо якийсь продукт можна зробити тільки завдяки коду, в майбутньому йому вартість буде прямувати до нуля. Бо подивіться, що одна модель може зробити за дуже короткий час. Хто так не думає, давайте посперечаємося в коментарях. І ще одна цікава особливість моделі Astra — це те, що вона може вирішувати дуже складні задачі в голові, не показуючи їх результат назовні. Те, що раніше в моделі робили через видимий ланцюжок міркувань, Astra може робити значно більш приховано. Потенційний плюс тут, очевидно, це може бути значно ефективніше, тому що не потрібно друкувати ланцюг токенів, а потім його розуміти назад. Але є і інша сторона.
Speaker A
Якщо ми не бачимо процес міркування моделі, нам складніше зрозуміти, чому вона прийняла конкретне рішення і що відбувається під капотом. І тут починаються дуже цікаві питання не тільки про можливості моделі, а й про їхню контрольованість, безпеку і так далі. Коротше, Astra виглядає як одна із моделей з найбільшими стрибками між поколіннями моделей, які ми бачимо. І після таких релізів теза про повільний розвиток AI виглядає все менш переконливо. Slow takeoff скасовується.
Speaker A
Що з цим робити, думаємо самі. Погнали далі. А якщо вам здається, що після цього Open AI перестали дивувати, ніфіга. Open AI заявили, що вирішили одну із задач тисячоліть. OpenAI опублікувала розв'язок задачі на Вєстокса, однієї з семи знаменитих задач тисячоліття, за розв'язання яких пропонували премію в мільйон доларів. Що таке взагалі задача на Вєстокса? Це задача, яка стосується рівнянь, які описують рухи рідин і газів: води в трубі, повітря навколо літака, вихорів у потоці. Суть питання була така: якщо задати початковий стан тривимірного потоку, чи залишатиметься його математичний розв'язок гладким упродовж всього часу? Чи за скінченний час може виникнути сингулярність, тобто точка, де опис руху стає нескінченним або перестає працювати? Ми вміємо чисельно моделювати багато потоків, але це не доводить, що для всіх допустимих початкових умов такого збою ніколи не станеться. Майже 90 років математики не могли довести, чи можуть рівняння на Вєстокса за певних умов приводити до сингулярності. І OpenAI заявляє, що їхня система знайшла такий випадок. Рідина, яка спочатку перебуває у спокої, за певних умов може прийти до сингулярності, де швидкість необмежено зростає за скінченний час. Як вони це зробили? OpenAI запустили одночасно близько 10 000 AI агентів, які паралельно працювали над проблемою. Вони обмінялись приблизно 2,7 млн повідомлень, згенерували близько 130 млрд аутпут токенів, а весь потік пошуку рішення зайняв 88 годин. Причому працювали вони на закритій внутрішній моделі Open AI, яка недоступна нікому і яка, за слухами від Open AI, набагато потужніша, ніж GPT Astra. Після того, як система агентів отримала рішення, GPT6 Astra витратила ще 17 годин, щоб формалізувати і перевірити докази у Link. Це така мова програмування і система для перевірки математичних доведень. За повідомленнями, весь цей експеримент коштував мільйони доларів обчислень, але Open AI не планує повертати собі премію в 1 млн. Та і ставити крапку поки зарано, поки це не доведено остаточно. Доказ ще має пройти незалежну перевірку і отримати визнання математичної спільноти, а це може зайняти місяці. Але навіть якщо відкласти саму задачу на Вєстокса, тут для мене набагато цікавіше інше. Ми бачимо абсолютно новий підхід до наукової роботи: не один AI замість одного науковця, а 10 000 агентів, які паралельно працюють як величезна цифрова дослідницька лабораторія. І якщо цей підхід працює на задачах такого рівня, то питання вже не в тому, якою стане наступна модель. Питання в тому, коли тисячі або десятки тисяч таких моделей одночасно почнуть працювати над однією науковою проблемою. Ставимо ставки. Гіпотеза Рімана буде цього року чи ні?
Speaker A
А поки Open AI вирішує задачі тисячоліття, інші моделі розібралися із загадками минулого. Fable 5.1 розшифрував загадку, яку не могли розшифрувати 370 років. Дослідник із WSS AI Габбі Джеф дав Fable 1 цікаву задачу: самостійно знайти якийсь досі нерозгаданий історичний шифр і спробувати його зламати. Модель обрала криптограму Томаса Едхарта 1653 року, яку згадували як нерозв'язану ще з Х століття. Fable знадобилося 44 хвилини і 176 000 токенів без втручання людини, щоб знайти ключ. А ключем була сама книга. Перед шифром було рівно 32 розділи. Кожне число означало: "Візьми слово" під цим номером у відповідному розділі, а потім його першу літеру. З цих літер і складалося приховане повідомлення: "Молитва за Карла I".
Speaker A
Після цього Fable таким самим підходом взявся і за другий нерозгаданий шифр Едхарта і теж змогла майже повністю його відновити. Хочеш не хочеш, але загадок у світі стає все менше. Фух. З наукою і загадками закінчили. Тепер до моделей, якими можна користуватись в роботі.
Speaker A
Google випустила вже третій GMI Flash за півтора місяця. Вийшла mini 3.8 Flash і цього разу головний апдейт — кодинг і агенти. Модель краще працює з довгими задачами, де потрібно планувати кілька кроків: кликати інструменти, писати код, перевіряти результати і продовжувати роботу. На деяких кодинг бенчмарках ця дешева 3.8 модель Flash вже наближається до значно дорожчих нтірмоделей. Але є цікавий нюанс. Google фактично дозволяє Flash думати більше. На складних задачах модель робить більше різаних кроків і повторних тулкон, тому одна задача потенційно може з'їдати більше токенів. Ціна поки 0,75 $ за мільйон інпутів і 3,75 за аутпут токени. Контекст більше мільйона токенів. Google намагається зробити з цієї моделі дешевого робочого агента. На простих задачах працюємо швидко, а на дорогих витрачаємо більше комп'ютера. Тож пробуйте і ви. А тепер погнали від тексту і коду до мультимодальності. Open AI оновила свій список моделей для генерації та редагування картинок. Chat JBT Images 2,5. Скачок грандіозний і результат дуже крутий. Картинки стали деталізованішими, реалістичнішими і модель краще зберігає об'єкти з референсів і точніше редагує саме зображення. Тому те, що ви попросили, тепер не ламається. А генерація стала до 50% швидше порівняно з Images 2.0. Але цікаво, що прокачали сам інтерфейс. З'явився скетч, де можна намалювати ескіз п
Speaker A
моделі робили через видимий ланцюжок міркувань, AsстRA може робити значно більш приховано. Потенційний плюс тут, очевидно, це може бути значно ефективніше, тому що не потрібно друкувати ланцюг токенів, а потім його розуміти назад. Але є і інша сторона.
Speaker A
Якщо ми не бачимо процес міркування моделі, нам складніше зрозуміти, чому вона прийняла конкретне рішення і що відбувається під капотом. І тут починаються дуже цікаві питання не тільки про можливості моделі, а й про їхню контрольованість, безпеку і так далі. Коротше, Astra виглядає як одна із
Speaker A
моделей з найбільшими стрибками між поколіннями моделей, які ми бачимо. І після таких релізів теза про повільний розвиток AI виглядає все менш переконано. Slow takeйof скасовується.
Speaker A
Що з цим робити, думаємо самі. Погнали далі. А якщо вам здається, що після цього Open AI перестали дивувати, ніфіга. Open AI заявили, що вирішили одну із задач тисячоліть. Openi опублікувала розв'язок задачі на Вєстокса, однієї з семи знаменитих задач тисячоліття, за
Speaker A
розв'язання яких пропонували премію в мільйон доларів. Що таке взагалі задача на В'язстокс? Це задача, яка стосується рівнянь, які описують рухи рідин і газів: води в трубі, повітря навколо літака, вихорів у потоці. Суть питання була така: якщо задати початковий стан
Speaker A
тривимірного потоку, чи залишатиметься його математичний розв'язок гладким упродовж всього часу? чи за скінченний час може виникнути сингулярність, тобто точка, де опис руху стає нескінченним або перестає працювати. Ми вміємо численно моделювати багато потоків, але це не доводить, що для всіх допустимих
Speaker A
початкових умов такого збою ніколи не станеться. Майже 90 років математики не могли довести, чи можуть рівняни на в'язсток це за певних умов приводити до сингулярності. І OpenIa заявляє, що їхня система знайшла такий випадок. Рідина, яка спочатку перебуває у спокої, за
Speaker A
певних умов може прийти до сингулярності, де швидкість необмежено зростає за скінченний час. Як вони це зробили? Openi запустили одночасно близько 10 000 AІ агентів, які паралельно працювали над проблемою. Вони обмінялись приблизно 2,7 млн повідомлень, згенерували близько 130 млрд аутпут токенів, а весь потік пошук
Speaker A
рішення зайняв 88 годин. Причому працювали вони на закритій внутрішній моделі Open AI, яка недоступна нікому і яка, за слухами від Open AI набагато потужніша, ніж GPT Astra. Після того, як система агентів отримала рішення, GPT6 Astra витратила ще 17 годин, щоб
Speaker A
формалізувати і перевірити докази у Link. Це така мова програмування і система для перевірки математичних довельнь. За повідомленнями, весь цей експеримент коштував мільйони доларів обчисленни, але Open AI не планує повертати собі премію в 1 млн. Та і ставити крапку, поки зарано, поки це не
Speaker A
доведено остаточно. Доказ ще має пройти незалежну перевірку і отримати визнання математичної спільноти, а це може зайняти місяці. Але навіть якщо відкласти саму задачу на в'єстокса, тут для мене набагато цікавіше інше. Ми бачимо абсолютно новий підхід до наукової роботи. не один AI замість
Speaker A
одного науковця, а 10 000 агентів, які паралельно працюють як величезна цифрова дослідницька лабораторія. І якщо цей підхід працює на задачах такого рівня, то питання вже не в тому, якою стане наступна модель. Питання в тому, коли тисяч або десятків тисяч таких моделей
Speaker A
одночасно почнуть працювати над однією науковою проблемою. Ставимо ставки. Гіпотеза Рівмена буде цього року чи ні?
Speaker A
А поки Open AI вирішує задачі тисячоліття, інші моделі розібралися із загадками минулого. Fable 5.1 розшифрував загадку, яку не могли розшифрувати 370 років. Дослідник із WSS AI Gabby Джеф дав Fable 1 цікаву задачу: самостійно знайти якийсь досі нерозгаданий історичний шифр і
Speaker A
спробувати його зламати. Модель обрала криптограму Томаса Едхарта 1653 року, яку згадували як не розв'язану ще з X століття. Fable знадобилося 44 хвилини і 176 000 токенів без втручання людини, щоб знайти ключ. А ключем була сама книга. Перед шифром було рівно 32
Speaker A
розділи. Кожне число означало: "Візьми слово" під цим номером у відповідному розділі, а потім його першу літеру. З цих літер і складалося приховане повідомлення: "Молитва за Карла I".
Speaker A
Після цього Фейбл таким самим підходом взявся і за другий нерозгаданий шифер Едхарта і теж змогла майже повністю його відновити. Хочеш не хочеш, але загадок у світі стає все менше. Фух. З наукою і загадками закінчили. Тепер до моделей, якими можна користуватись в роботі.
Speaker A
Google випустила вже третій GMI Flash за півтора місяця. вийшла mini 3.8флеш і цього разу головний апдейт - кодинг і агенти. Модель краще працює з довгими задачами, де потрібно планувати кілька кроків: кликати інструменти, писати код, перевіряти результати і продовжувати
Speaker A
роботу. На деяких кодінг бечмарках ця дешева 3.8 модель флеш вже наближається до значно дорожчих нтірмоделей. Але є цікавий нюанс. Google фактично дозволяє флеші думати більше. На складних задачах модель робить більше різаних кроків і повторних тулкон, тому одна задача
Speaker A
потенційно може з'їдати більше токенів. Ціна поки 0,75 $ за мільйон інпутів і 3,75 за аутпут токени. Контекст більше мільйона токенів. Google намагається зробити з цієї моделі дешевого робочого агента. На простих задачах працюємо швидко, а на дорогих витрачаємо більше
Speaker A
комп'ютера. Тож пробуйте і ви. А тепер погнали від тексту і коду до мультимодальності. Open AI оновила свій список моделей для генерації та редагування картинок. Chat JBT Images 2,5. Скачок грандіозний і результат дуже крутий. Картинки стали деталізованішими. реалістичнішими і
Speaker A
модель краще зберігає об'єкти з референсів і точніше редагує саме зображення. Тому те, що ви попросили, тепер не ламається. А генерація стала до 50% швидше порівняно з імes 2.0. Але цікаво, що прокачали сам інтерфейс.
Speaker A
З'явився скетч, де можна намалювати ескіз прямо в чат GPT, коментарі прямо на картинці для точкових правок і готові шаблони для постерів, мерчу та інших форматів. Для АІ також вийшли дві моделі: GPT Image 2,5 FL, швидка для більшості задач і Sunbst для більш
Speaker A
точного редагування. Коротчуча поступово перетворює генератор картинок на повноцінний AI-редактор. А ще на моїх тестах дуже класно працює перекладання тексту на різні мови на картинках. Можна користуватись.
Speaker A
З картинками розібрались. А що ж там з відео? Black Forest Lab випустили Flux Video Edit. І це по суті нанобана для редагування відео. Беремо готовий ролик, просто кажемо промтом, що ми хочемо змінити. Об'єкт персонажа, фон, матеріали, текст, ефекти і навіть те, що
Speaker A
відбувається на сцені. І воно все змінює і працює. Можна навіть змінювати репліки і перекладати діалог іншою мовою з Lips і основне тут ціна 3 цен секунду. Тобто 10 секунд від редагованого відео будуть коштувати вам всього 30 центів. Короче,
Speaker A
генеративне редагування відео стає не тільки нормальним, а ще й дуже дешевим. Користуємося. Картинки розібрали, відео є. Тепер звук.
Speaker A
Tens випустила нанобана для аудіо. Те саме, що і для відео. Повнює редагування аудіо за допомогою промта. можна клонувати голос, замінити окремі слова без перезапису всієї фрази, прибрати шум або акцент, змінити емоцію, тембер, швидкість і навіть виокремити окремий голос чи вокал від міксу. І головне, код
Speaker A
вагі та кофійноди вже доступні і можна тестувати самому. Я теж спробував зробити voice adнтингing. Я записав фразу: "Мене звати Паша, я живу в Україні" і попросив замінити Україну на Польщу. Правда, робив це на англійській мові, тому що з українською воно працює
Speaker A
сильно гірше. І результат вийшов ось такий. Hello, my name is Pasha and I living Ukraine. Hello, my name is Pasha and I live in Poland. Тестуйте і ви.
Speaker A
Будь-який GitHub репозиторій тепер можна розібрати за допомогою AI. З'явився Art GitHub- сервіс, який дозволяє швидко розібратись в чужому GitHub репозиторії за допомогою AI без знання кода. І фішка в тому, наскільки це просто. У посиланні на репозиторії просто заміняємо GitHub
Speaker A
на RG GitHub. Далі AI і сам аналізує код, розбирається зі структурою проекту, намагається налаштувати середовище і навіть запускає цей репорторій. Тобто замість того, щоб годинами колупатися в чужому коді, можна просто віддати весь репозиторій агенту і попросити пояснити, що там відбувається, як там працює все і
Speaker A
з чого почати, і при цьому це все безкоштовно. Ще один маленький крок до світу, де читати чужий код взагалі не обов'язково.
Speaker A
А ще на додачу з'явився інструмент Understand Anything, який перетворює цілий репозиторій на інтерактивний граф знань. Він проходиться по файлах, функціях і класах залежності і будує карту проект, де можна клікати по всім компонентам, дивитися зв'язки, записувати AI, як усе працює. Особливо
Speaker A
корисно, коли ви заходите в новий проект або намагаєтесь розібратись з Legacy кодом. Працює з кладкодом, курсором, кодексом, копайтом J mini CLI і іншими кодінгтами. Замість тисячі рючків чужого коду спочатку дивимося на карту і вже потім ліземо всередину.
Speaker A
А тепер переходимо до швидких топ-три знайдених АI за цей тиждень. Перше. Одна фотографія кімнати, готовий набір 3D-моделек. Знайшов цікавий сервіс, який називається MН. Завантажуєте одну фотографію кімнати і розпізнає окремі предмети і мебелі і перетворює їх на окремі 3D сети. Потім ці моделі можна
Speaker A
використати, імпортувати зразу в блендер і зібрати з них власні сцени. А ще Mint вміє створювати цілі 3D світи та Housing split сцени, які можна відкривати прямо в браузері. Інструмент номер два. Як за секунду дізнатися, які шрифти використовує будь-який сайт?
Speaker A
Безкоштовний сервіс Phone Steeler нам з цим допоможе. Просто вставляємо URL сайту, а сервіс знаходить активні веб-шрифти, показує їхні стилі та накладання і підбирає безкоштовні альтернативи. Впевнений, для дизайнерів точно буде корисно. Сервіс номер три.
Speaker A
Безкоштовний AI encer прямо в браузера. Називається інструмент неромережа Fine Grin Image enhanced. Все максимально просто. Завантажуємо картинку, enhance image, отримуємо покращену версію.
Speaker A
Важливий нюанс, що це саме генеративне покращення, тому модель може трохи змінювати дрібні деталі, а не просто збільшувати роздільну здатні. Але для старих, розмитих або просто маленьких картинок цікава, безкоштовна штука.
Speaker A
Користуємось. А якщо TikTok ще недостатньо розрядив вам мозок, зустрічайте VIP, нескінченну стрічку з навайбкодженими міні-додатками. Пишете щось типу зроби гру, де кіт ухиляється від піци, я створюю міні-додаток і ви одразу публікуєте його у стрічку. Там є ігри, квізи, опитування, різні маленькі
Speaker A
інструменти. Їх можна лайкати, коментувати, зберігати і навіть реміксити чужі додатки під себе. Коротше, чекаємо наступний рівень, операційну систему, де все буде генеруватися протами.
Speaker A
І на завершення, раз уж постійно говоримо про кодінг агентів, маленький бонус для тих, хто користується клод-кодом. Для тих, хто перевіряє клод, кожні 10 секунд з'явилась маленька утиліта для Mac Clatus бар. Вона показує прямо у верхньому меню Мака, що зараз
Speaker A
робить клодкод і скільки часу він працює. А коли агент закінчив або чекає на вас, це одразу видно. Тому більше не треба кожні 10 секунд переключати вкладки в терміналі і дивитися ну щото безкоштовно. і Open source.
Speaker A
Друзі, сьогодні на цьому все. І якщо подивитись на наш список новин сьогодні, найбільше мене вражає в ньому те, як ми переходимо до роботи. Замість того, щоб годинами сидіти в якомусь інструменті, ми використовуємо один промт. Розібрати чужий код, відредагувати відео, створити
Speaker A
3D-сцени, покращити картинку, відео, аудіо. Список росте кожні два тижні. Тому моя порада незмінна менше читати AI новин і більше пробувати все це на своїх робочих кейсах. А я продовжуватиму фільтрувати весь це AI шум за вас.
Speaker A
Підписуйтеся на канал і ставте лайк цьому відео. А ще підписуйтесь на мене Instagram та Лін 1. Там теж багато корисного і цікавого контента. Це був четвертий випуск шоу Ашумлять.
Speaker A
Побачимось за два тижні. Пока-пока. He.
Topics:GPT6 AstraAGIOpenAIзадача ВєстоксаAI агентиGoogle GMI FlashFable 5.1штучний інтелектнаукові дослідженнягенерація зображень











