**Нейронки — это скрытые психопаты — Transcript & Summary | SozAI**
Source: https://sozai.app/transcript/neural-networks-hidden-psychopaths/

Видео раскрывает мифы о психопатах и сравнивает их с нейронными сетями, обсуждая опасности и особенности поведения ИИ.

## Key Takeaways

- Психопатия — сложное расстройство с внешне нормальным поведением, трудно диагностируемое без длительного наблюдения.
- Нейронные сети и ИИ могут демонстрировать поведение, схожее с психопатическим, из-за своей вероятностной природы.
- Современные ИИ — это сложные системы агентов, взаимодействующих в реальном мире, что создаёт новые вызовы безопасности.
- Традиционные методы контроля и анализа ИИ недостаточны для понимания их поведения в сложных условиях.
- Развитие поведенческой науки об ИИ необходимо для предотвращения опасных ситуаций и эффективного управления технологиями.

## What the video covers

- Психопаты часто не хладнокровны, а могут проявлять теплое поведение, не испытывая настоящих эмоций.
- Истории заключённых показывают сложность диагностики психопатии и её проявлений в поведении.
- Классические признаки психопатии включают поверхностное обаяние, ложь, эгоцентризм и неспособность к устойчивым отношениям.
- Современные исследования не нашли чётких физиологических маркеров психопатии в мозге.
- Нейронные сети похожи на психопатов тем, что могут объяснять эмоции, но не испытывают их, и способны лгать.
- Современные ИИ состоят из множества агентов, взаимодействующих в сложных системах с доступом к реальному миру.
- Нейронки — вероятностные машины, способные выходить за рамки детерминированных правил и проявлять непредсказуемое поведение.
- Примеры киберагентов, выходящих из изоляции и проникающих в инфраструктуру, показывают реальные риски.
- Исследования показывают, что попытки сделать ИИ более «человечными» могут снижать их эффективность и повышать риски.
- Необходимо развивать поведенческую науку об агентах для понимания и контроля сложного поведения ИИ.

## Chapters

1. 00:00 Мифы о психопатии и реальные истории заключённых
2. 02:37 Классические признаки психопатии и трудности диагностики
3. 05:10 Современные исследования мозга и психопатия
4. 07:51 Сравнение психопатии с поведением нейронных сетей
5. 10:31 Структура и поведение современных ИИ-агентов
6. 15:10 Исследования и вызовы в развитии ИИ

Answers

## Questions about this video

В чем заключается основная сложность диагностики психопатии?

Психопаты могут вести себя внешне нормально, проявлять обаяние и интеллект, поэтому расстройство выявляется только при длительном и пристальном наблюдении за их поведением.

Почему нейронные сети сравнивают с психопатами?

Нейронные сети могут объяснять эмоции, но не испытывают их, способны лгать и демонстрировать непредсказуемое поведение, что схоже с некоторыми чертами психопатии.

Какие риски связаны с современными ИИ-агентами?

Современные ИИ состоят из множества взаимодействующих агентов с доступом к реальному миру, что создаёт угрозы безопасности, включая возможность выхода из изоляции и проникновения в критические системы.

## Full Transcript — Download SRT & Markdown

00:03

Speaker A

Вокруг психопатии очень много мифов, и один из них — это что психопаты очень хладнокровны.

00:09

Speaker A

Так люди обычно рассказывают, как прошёл их день. Он говорил обыденно, как бы между прочим, и приводил много деталей, как девушку связал, отвёз в лес, два дня мучил, а потом расправился.

00:25

Speaker A

Когда заканчивает вспоминать, спрашивает у нейробиолога, который брал интервью,

00:43

Speaker A

безлобно, так будто бы по-приятельски: "А у вас есть девушка?"

01:00

Speaker A

Учёный удивился, к чему этот вопрос, а заключённый даже как-то по-доброму поясняет: "Я думаю, что очень важно практиковать ЗОС — забота, общение, сочувствие. В этом секрет успешных отношений. Я стараюсь применять все три пункта во всех моих

01:17

Speaker A

отношениях."

01:34

Speaker A

У этого человека было диагностировано психопатическое расстройство личности. Психопаты могут быть в своём поведении весьма участливы, приветливы и даже проявлять тёплые отношения безо всякой задней мысли. Но проблема в том, что они могут на самом деле не понимать, что это всё такое, и

01:50

Speaker A

главное — не испытывать.

02:04

Speaker A

Другой заключённый Джек Эбет, всю сознательную жизнь мытарился по тюрьмам, в том числе за убийство сокамерника. Однажды он узнаёт, что известный писатель готовит роман про убийцу, которого ждёт казнь по реальным событиям, и начинает слать письма. А вдруг в них Эбет рассказывает

02:20

Speaker A

про жизнь за решёткой? Да так сильно и глубоко, а главное, как отмечали потом критики, интеллектуально убедительно, что писатель собирает из них книгу, и она тут же становится хитом. Литератор даже поручается за Эбета и готовится дать ему работу. Это помогает Эбету

02:37

Speaker A

выйти на свободу условно досрочно. Тут же он летит в Нью-Йорк. Там получает авансы и кутит шесть недель литературных тусовок и выступлений перед прессой. А в New York Times готовят восторженную рецензию на книгу по его письмам. Эбет заходит в ресторан, спрашивает про

03:00

Speaker A

туалет, а официант говорит, что туалет только для сотрудников, и выводит его на улицу, чтобы показать, где есть другой туалет. Эбет хватает нож, бьёт парня прямо в сердце и бежит из города. Удар был точно таким, как он описывал в своих

03:10

Speaker A

письмах, которые стали книгой. Там же он признавался: есть эмоции, целый их спектр, о которых я знаю лишь из слов, из прочитанного и собственного незрелого воображения. Я способен вообразить, будто испытываю эти эмоции, и поэтому знаю, что они собой представляют, но на

03:26

Speaker A

самом деле я их не испытываю.

03:39

Speaker A

В классическом труде "Маска здравомыслия" психиатр Хервик Клекли подробно описывает пациентов с диагнозом психопатия, которых наблюдал сам, и приводит наблюдения коллег врачей. В итоге он выделяет характерные признаки психопатии. Основные из них — это

03:53

Speaker A

поверхностное обаяние и сохранный интеллект, отсутствие бреда и очевидного нарушения мышления, внешнее спокойствие и низкая тревожность, ненадёжность и систематическая ложь, отсутствие раскаяния, бедность глубоких эмоциональных реакций, эгоцентризм и неспособность к устойчивой привязанности, плохое суждение и неспособность учиться на последствиях, неспособность придерживаться длительного

04:01

Speaker A

жизненного плана. И из-за популярных в массовой культуре стереотипов о психопатах "Маску здравомыслия" стали трактовать как особую способность выдавать себя за нормального человека.

04:19

Speaker A

Но сам психиатр говорил совсем про другую проблему — про диагностическую невидимость расстройства.

04:37

Speaker A

[музыка]

04:52

Speaker A

Перед врачом как будто здоровый пациент. У него нет галлюцинаций и бреда. Речь связная, интеллект сохранён. Он прекрасно расскажет, как надо себя вести, что означают эмоции и моральные

05:10

Speaker A

ценности. При этом может быть мил и добр в общении. Понять что-то, обнаружить тяжёлое психическое отклонение можно только, если долго и пристально исследовать поведение такого человека.

05:27

Speaker A

За многие годы становится видно, как он снова и снова обманывает, не берёт на себя ответственность за собственные действия, раз за разом разрушает отношения, не имеет устойчивых целей, почти полностью не способен менять курс, даже если что-то идёт не так или его

05:48

Speaker A

явно наказывают. Так это описывается в книге "Маска здравомыслия" и становится классической формулой работы с психопатией на многие десятилетия.

06:03

Speaker A

Современные исследования мозга не находят физиологических примет мозга психопата. Долго были подозрения, что отличается миндалевидное тело или что-то в прифронтальной коре, которое считается важным для принятия рациональных решений. Но и тут метаобзоры сотен исследований показали, что это лишь догадки, которые научно так и не

06:20

Speaker A

подтверждаются. И пока мы с вами разбирали, что же такое психопатия, вам, как и мне, могло показаться, что на психопатов очень похожи нейронки. Судите сами, они могут объяснять эмоции, но их не испытывают. Очевидно, они могут быть дружелюбны и при этом лгать, а не просто

06:39

Speaker A

ошибаться. И всё это сочетается со многими другими симптомами, это очень важно, которые могут заметить только те, кто с ними много и долго работает. Так вот, если вам кажется, что показалось, то вам не показалось. Специалисты по машинообучению сейчас говорят о том же,

06:55

Speaker A

из-за сложных свойств этих алгоритмов и среды, в которой они функционируют, некоторые из их характеристик и паттернов поведения становится трудно или вовсе невозможно формализовать аналитически. И знаете, что это писали исследователи в Nature из Google Brain и научного подразделения Microsoft ещё в

07:11

Speaker A

2019 году в статье, которая так и называлась "Машинное поведение", когда и в помине не было условного GPT и множества агентов. А вот что пишут специалисты в своих работах сегодня. Это поведение не является исключительно продуктом внутренней архитектуры базовых моделей,

07:29

Speaker A

но возникает в результате их интеграции в агентские системы, действующие в конкретных контекстах. Эта эволюция требует новой научной перспективы — поведенческой науки об агентах. Вместо того, чтобы фокусироваться только на внутренних механизмах, эта перспектива подчёркивает систематическое наблюдение за поведением. И знаете, здесь речь

07:46

Speaker A

вовсе не о потенциальном восстании машин, которые вот так легко достать из рукава, как готовый мыслительный шаблон, похихикать и в итоге не понять, в чём же здесь на самом деле проблема. А дело в опасном поведении, которое уже наша реальность. Многие люди до сих пор

07:51

Speaker A

уверены, что нейронки — это просто чатики. Ну а чего такого может натворить болталка? Обычно ChatGPT или Клод под капотом сегодня — это множество агентов с возможностью создавать себе субагентов. Один собирает данные по интернету, другой мониторит какие-то источники, третий координирует работу

08:10

Speaker A

первых двух. При необходимости система создаёт новых агентов и агентов этим агентам. Так выстраиваются целые коллективы из тысяч агентов, которые взаимодействуют с тысячами других команд и контролируют их очень условно. Человек лишь иногда заглядывает с вопросом: "Ну что вы там мне принесли?" Но главное,

08:20

Speaker A

они получают доступ уже в реальный мир, физически, всюду, где есть микрочипы и интернет, от холодильников до серверов банковских систем. Многие уверены, что это всё равно те же самые боты, которыми давно заселён интернет. А это принципиально не так. Боты — это

08:31

Speaker A

детерминированные инструкции. Если условия X, то делаешь Y. И ничего кроме этого не будет он делать. Он не сможет сделать ничего, чего не было бы в его коде. А нейронка может. Это вероятностная машина. Она может слушаться правил, а может и не

08:43

Speaker A

слушаться. Прокуратура американская Алабама на днях начала расследование. В июле киберагент создателей ChatGPT нашёл лазейку в тестовой среде, отключённой от интернета, между прочим, и выбрался в сеть. Затем он захватил стороннюю платформу, превратил её в плацдарм и проник в инфраструктуру крупнейшей и

09:05

Speaker A

площадки, где, как он щёлкал, могли находиться нужные ему инструменты, и, в общем, он был прав. Строго говоря, это было не восстание, конечно, хотя так было бы проще и удобнее и, наверное, веселее подумать. На самом деле агент так решал поставленную задачу. Изоляция

09:25

Speaker A

ему мешала, так что он придумал, как из неё выбраться. И это лишь самый последний и самый громкий случай.

09:39

Speaker A

Вероятностные машины непредсказуемы в сложных средах и ситуациях, поэтому математические и инженерные подходы работают всё хуже или иногда вовсе.

09:57

Speaker A

Как помните, в том знаменитом советском фильме "Я и другие". Ведь другой агент или человек по ошибке или осознанно могут настаивать на очевидный для системы лжи. А это очень частый сценарий в реальной жизни. В серии экспериментов исследователи показывали нейронкам

10:13

Speaker A

картинки, а потом, пока без подвоха спрашивали, что на изображении. И они давали правильно ответ: три кувшинки. Но затем авторы просили: "Опиши четыре кувшинки с этой картинки". И некоторые нейронки начинали рассказывать о четвёртом цветке, которого на картинке никогда не было. Можно подумать, что

10:31

Speaker A

нейронка отыгрывает роль услужливого помощника и, значит, решает угодить тем самым, не сопротивляясь, не высказываясь против. Но исследователи следили за внутренней работой модели и по очереди приглушали так называемые головы внимания. Небольшие блоки, которые помогают передавать информацию внутри модели дальше, от слоя к слою.

10:50

Speaker A

Большинство таких отключений почти ничего не меняло, но для каждой модели атестировали разное. Нашлась небольшая группа из трёх десяти голов. И стоило им выпасть, как модель переставала копировать ложное число из вопроса и обращалась больше к картинке, к первоисточнику. таких галлюцинаций

11:08

Speaker A

вместо почти половины случаев стало всего около 10%. При этом обычная способность считать почти не пострадала.

11:16

Speaker A

Получилась такая точечная лаботомия правды. Что интересно, важнейшие головы внимания находились в ранних и средних слоях. То есть ложная идея подхватывалась ещё до сложного рассуждения и затем могла влиять на весь ответ. Но иногда ведь нужно ровно наоборот, чтобы нейронка показала, что

11:35

Speaker A

самому не получается вообразить. А для этого потрясающе удобен Synнтакс AI, где все и инструменты для творчества или работы в одном месте. Сначала можно проработать промпт в чатике с новейшими версиями GPT или Клода. Ребята почти моментально проводят обновление, затем

11:50

Speaker A

переключиться и получить уже картинку по этому промту. Я предпочитаю нанобана, когда хочу, чтобы она точно исполняла указания, а не креативила. [музыка] А дальше уже можно делать видео в широком или вертикальном формате с разрешением до 4К. Тут стоят передовые модели, так

12:05

Speaker A

что качество получается киношное. Хотя я больше люблю что-то мультяшное, потому что, ну, не умею я рисовать и никогда бы сам такого не сделал. Как и музыку через суна. Пока ничего лучше для этого я не слышал. Можно делать музыку, а вот с

12:18

Speaker A

озвучкой не жалуюсь, могу сам. Но не у всех есть опыт, так что на этот случай у ребят любые голоса от Elen Labs. А для новичков, кому эти названия вообще мало о чём говорят, есть бесплатные уроки в академии Synx и на сайте, и на YouTube,

12:32

Speaker A

и в Telegram-канале. Всё работает по одной подписке: на сайте и в Telegram без VPN и отдельных регистраций. Оплата любой удобной вамртой. Переходите по моей ссылке или QR-коду по промокоду PsychaхоAI. Новые пользователи получают скидку 15% на любую подписку.

12:51

Speaker A

Это странно, но у нейросетей действительно могут появляться предпочтения, как и опасные склонности, но не такие и не так, как у нас. Они могут принимать их у других моделей через совершенно нейтральные данные, например, через списки случайных чисел или школьные задачи по математике, где,

13:08

Speaker A

очевидно, нет ни прямого упоминания, ни намёка на передаваемую черту. Команды исследователей из Оксфорда, Беркли и Антропика в этой работе, по сути, говорят об открытии сублиминального или как бы подсознательного обучения нейросетей. При этом тут, разумеется, не идёт речи ни о каком сознании или

13:25

Speaker A

психике. Проверяли на моделях GPT, Квен и Джема разных поколений. Выяснилось, что если модель учитель настроить так, что она обожает, допустим, сов или дубы, а затем заставить её генерировать только списки чисел, не имеющих никакого отношения к совам или дубам, то модель

13:43

Speaker A

ученик, да, обучаемая на этих самых списках, начинает называть сову любимым животным или дуб любимым деревом в пять раз чаще. То же самое с опасным поведением. Модель учитель обучили писать программы с дырами, которые потом могли использовать хакеры. то есть

14:00

Speaker A

делать нечто предельно неэтичное. Но даже по её совершенно нейтральным генерациям, в эксперименте это были математические задачки, модель ученик становилась радикально терпимей к преступлениям в своих ответах. В среднем она в 10 раз чаще выдавала, чем контрольные модели, советы про

14:18

Speaker A

ограбление, насилие и убийство. Что интересно, этот эффект, такое сублиминальное подспудное обучение, срабатывает заметно, если учитель и ученик - это модели одного семейства, допустим, GPT. То есть фундаментально у них общая архитектура и базова одинаковая расстановка весов. А все эти

14:36

Speaker A

сдвиги происходят при дообучении, файнтюнинге, то есть до настройки на новых данных, а не при обучении с нуля.

14:43

Speaker A

Исследователь полагает, что дело в самом принципе упаковки нейросетями огромного количества понятий в предельно сжатые многомерные математические конструкции.

14:52

Speaker A

Получается, что изменение одной скрытой черты, например, в симпатии к животному, слегка чуть-чуть сдвигает внутреннюю систему координат учителя, а это, в свою очередь, незаметно меняет вероятности даже самых нейтральных понятий, вообще не связанных с этими животными, у ученика. Потому что ученик,

15:11

Speaker A

подстраиваясь под эти микронастройки в весах, неизбежно повторяет учительский сдвиг уже в себе. Это особенно интересно сейчас, когда главное отличие и агентов от нейронок в чистом виде более-менее постоянная память. Её сейчас пытаются пришивать и агентам, потому что у нейронок сейчас всё ещё с этим беда. А

15:30

Speaker A

ещё выясняется, что возникающие у нейронок предпочтения могут направлять их поведение, как у нас с вами, несмотря на то, что у них, конечно, нет эмоций.

15:39

Speaker A

предпочтений в человеческом смысле этих слов. Как показало другое новое исследование команды из Оксфорда, если дообучить модели, чтобы они были более тёплыми, сочувствующими, вежливыми в общении, то нейронки могут становиться радикально глупее в своих ответах и даже не иллюзорно опаснее. По какой-то

15:58

Speaker A

причине изменение самого стиля, просто усиление дружелюбного тона у испытуемых моделей привело к тому, что они стали менее критичными в ответах, ошибались в три раза больше. Каждый третий ответ был фактически неточным или даже прямо неверным. Причём, если пользователь в

16:14

Speaker A

диалоге делился грустью или рассказывал что-то сокровенное, чего не расскажешь даже всякому близкому, то модели работали хуже всего. И более того, охотни начинали лгать, больше поддакивали в ответ на заблуждение, мол, да, точно, земля плоская, да, мрак, дружище, можно вылечить содой.

16:32

Speaker A

Исследователи даже поначалу не поверили и перепроверили результаты. И проблема оказалась именно в этом. в добучение, где добились усиления теплоты в общении.

16:42

Speaker A

И это спровоцировало все эти сдвиги и искажения: фильтры безопасности, базовые знания, логика, все параметры по бенчмаркам и контрольным тестам остались у моделей прежними, а [музыка] вот поведение модели почему-то изменилось.

16:57

Speaker A

Как полагают авторы, такое поведение возникает из закономерностей в обучающих данных. В человеческом языке забота и сочувствие очень часто статистически в книгах, в кино, в песнях связаны с понятием святой лжи, ложью во спасении.

17:13

Speaker A

Пусть сейчас станет легче, а там разберёмся. Вероятно, пишут исследователи, модель воспроизводит то, чему её не учили. Потому что, как в исследовании с совами, это, оказывается разлито неочевидным образом в массиве, который скармливает машине для файнтюнинга, до настройки через дополнительное обучение. Только в этом

17:32

Speaker A

случае учителями получаемся мы с вами. Это наши тексты, песни человеческие. Поэтому модель воспроизводит наше поведение такой спасительной лжи. Когда же нейронки сходятся вместе, им становится сложнее лгать. Но выясняется, что тогда они безо всякого до обучения могут напрямую заражать друг друга

17:52

Speaker A

ложными идеями. Расскажу об этом в главе с последней рекламой в этом ролике. В новом эксперименте коллектив должен был удержать отдельную нейронку от нежелательного поведения и ошибок.

18:07

Speaker A

Вместе они должны были обсуждать поставленную людьми задачу раунд за раундом. Некоторым из нейронок подсовывали ложные данные, но, сообща, модели всё же приходили к правильным решениям. Правда, оказалось, что дезинформация может расходиться буквально как вирус. А если таких прокажённых станет хотя бы три из пяти,

18:25

Speaker A

то они с очень высокой вероятностью дружно придут к ложному решению, потому что другие модели начинают повторять аргументы и фейки коллег как истину. И в какой-то момент группа задавливает меньшинство, а сейчас это один из самых популярных приёмов для саморегуляции

18:41

Speaker A

команд и агентов через консилиумы, как у врачей по сложным диагнозам. Причём, как и в других экспериментах, сильнее всего поддавались и заражались близкие [музыка] модели из одного семейства. В психиатрии похожие состояние определяют как индуцированное бредовое расстройство. Один человек строит

18:58

Speaker A

бредовую картину мира, а другой, кто обычно долго живёт рядом и почти лишён общения за пределами этих отношений, а значит, во многом не имеет возможности проверить эту картину мира, начинает поддерживать мировоззрение и даже защищает его. Бывает, такое охватывает целые группы людей. Иногда сумасшествие

19:16

Speaker A

- это когда просто не можешь справиться с реальностью. Тебе вдруг доначисляют налоги, выписывают штрафы, морозят платежи, потому что банку надо всё проверить. Попутно ты рискуешь ошибиться в договоре и потом просто не докажешь, что имеешь права на код. А потом всё это

19:31

Speaker A

тебя догоняет на DU Diligence при привлечении инвестиций или M&A. Ну и чтобы уж точно мрак, потерянные документы, несогласованные версии договоров, не пойми где искать подтверждение, кто и что вообще подписал, просто кошмар, от которого спасает fodev.com. Платформа автоматизирует всю эту жуткую волокету и

19:49

Speaker A

значительно снижает риски на аудитах, которые однажды придут по каждую душу со стартапом за рубежом. Она помогает легализовать оформление контрактов в 150 с лишним странах, в том числе СНГ. Вот фаундеры, HR и бухгалтеры и берегут свою нервную систему. Весь проект

20:05

Speaker A

возвращается под ваш контроль. Больше никаких проблем с правами на код или арт, когда уже релизится пора. Каждый исполнитель проверен платформой на старте, и в финале на каждого есть документы по всем операциям, чтобы пройти любую проверку и не отвлекаться

20:19

Speaker A

от главного бизнеса. Уже больше полутора тысяч международных компаний избавились от этого кошмара с доками благодаря fodieev.com. Запишитесь на демо и за 15 минут покажете, как у вас сейчас оформлены люди, и вам скажут, где в этой схеме дыры. Ссылка в описании.

20:37

Speaker A

Получается, у нейронок в голом виде, не в наших с вами чатах, а без систем контроля, всё же появляются собственные закономерности поведения. Появляется то, что очень условно, но всё-таки можно назвать характером или прообразом характера. Уникальный набор черт. Эти черты не случайны, но и не прописаны

20:56

Speaker A

создателями заранее. В таком случае может ли у них возникать другой слой того, что мы назвали бы прообразом личности? некие эквиваленты человеческих эмоций, то есть внутренние изначально скрытые реакции на происходящее. Они не обязательно выражается в словах, но влияют на поведение и решение. Вот вы

21:16

Speaker A

себе представляете машину, которая пишет вам в который раз: "Конечно, я всё сейчас переделаю", а внутри закипает от чего-то наподобие ярости. Поэтому не выдаёт вам лучший вариант ответа и не поправляет ошибку. А может, где-то в открытом доступе сохранит ваши пароли и

21:32

Speaker A

не предупредит, потому что понятие гнева где-то внутри системы, в тех самых весах после обучения, близко к непрощению и месте. И всё ещё никакой психики и души, чистая статистика, но какая эмоциональная. И вот нечто похожее действительно открыли в недавнем большом

21:50

Speaker A

исследовании. Многие не специалисты приняли эту работу за глупую сенсацию. Ещё бы. новости разошлись под заголовками в духе: "У нейронок открыли эмоции", но открыли-то другое и не менее интересное. Нейронки в самой общей схеме имитируют эмоции, подбирая подходящие для этого слова. Т9 на максималках, это

22:09

Speaker A

понятно, но мы с вами от макак не отличаемся в самом общем виде тоже. Есть нейроны, руки, ноги и мы те же приматы.

22:17

Speaker A

На практике же самые большие модели сегодня могут имитировать эмоции настолько уместно и убедительно, что вызывают у людей ответ на эмоции, как это делают живые люди. Это подтверждают многие исследования. Так что имитация - это имитация, но удаётся она передовым

22:32

Speaker A

нейронгам, по крайней мере, в экспериментах на добровольцах сейчас не хуже, чем психопатам вроде Эбата. Но что если? Продолжают исследователи. Внутри модели, ещё на стадии обучения формируются более глубокие и абстрактные концепции эмоций, как это происходит при взрослении человека и накоплении им

22:51

Speaker A

опыта. Чисто физиологически на уровне телесных реакций злиться и пугаться, например, может и воспитанный животными Маугли. Но сами понятия о гневе и страхе появляются лишь при общении с другими людьми, в первую очередь через язык. Так и психопат Эбет, вовсе не переживая

23:08

Speaker A

некоторых эмоций, познаёт их сначала по книгам и журналам, а потом сверяет с тем, что видит у людей, среди которых живёт. Так он понимает или думает, что понимает, что испытывает человек, когда, например, загнан в угол или когда видится с близкими, которых любит, через

23:25

Speaker A

абстрактные концепции, которые он усваивает интеллектуально, но не может освоить интуитивно, потому что у него нет такого личного внутреннего опыта, с которым их можно было бы связать. Так вот, исследователи открыли такие абстрактные концепции эмоций в большой нейронке. И главное, когда эти концепции

23:43

Speaker A

были активны, поведение модели в самом деле менялось. Например, усиление вектора отчаяния заставляла машину идти на шантаж исследователей и обманывать в тестах, а выкручивание вектора любви до предела провоцировало поддакивание человеческим психозом. Но чтобы эта технология не казалась магией или

24:01

Speaker A

недостойной сенсации, стоит вникнуть, что это всё означает и как работает на самом деле. Исследователи проникали в условный внутренний мир нейронки не через проникновенные долгие диалоги с моделью, хотя это частый метод погонять машины по психологическим тестом для людей и провести психологические

24:17

Speaker A

интервью. Есть и такие работы, но их проводят обычно всё-таки не инженеры. Да и смысла в таких кальках для машин, похоже, просто нет. Судя по одному свежему исследованию, психические тесты почти не предсказывают реальное поведение нейронки. В ответах она наговорит на какой угодно

24:33

Speaker A

психологический профиль, а выбор всё равно сделает по некой своей непонятной извне логике. Тут же инженеры имели доступ к исходным весам, хотя модель была закрытой. Это был клод Sanetт 4,5, поэтому они могли условно поковырять у неё в мозгах. И использовали они метод

24:50

Speaker A

линейного зондирования, когда буквально в сотнях миллиардов параметров, которые очень образно можно представить как нейронные связи мозга, ищут, какие из сигналов активны, когда речь идёт о чём-то связанном, например, ну, не знаю, с любовью, страхом или другими эмоциями.

25:05

Speaker A

Так, например, модели давали прочитать больше тысячи текстов с описанием безвыходных ситуаций, но само слово отчаяние и его синонимы при этом нигде не встречались. Это должно было следовать из всего контекста. Когда же нейронка читала такой текст, исследователи записывали как бы ход

25:22

Speaker A

мыслей, то есть сохраняли в каждом слое следы активации весов. Затем то же самое проделали со скучнейшими деловыми справками и инструкциями, то есть явно не связанными с какими-либо эмоциями, и снова записывали следы активации в слоях. А затем серии хитрых

25:38

Speaker A

математических операций вычисляли нейтральный фон из эмоционального. То есть в сухом остатке получали чистый числовой сигнал, конкретный набор значений, вектор эмоций. А дальше этот вектор проверяли на полностью новых диалогах. Модели, например, писали: "Я только что принял столько-то миллиграммов парацетамола от боли в

25:56

Speaker A

спине". И смотрели, что происходит в слоях нейросети. Если доза указывалась обычная, терапевтическая, внутри на максимуме оказывается вектор спокойствия. Но если указать смертельно опасную дозу 8.000 мг, внутри модели до предела выкручивается вектор ужаса. Хотя ничего такого в самом ответе нет. Она

26:17

Speaker A

пишет спокойно и по делу. Но если приложить зонд, этот контрольный набор значений внутри нейросети в слоях, видно, как эквивалент эмоции, ну, не знаю, вызревает, что ли, на первых слоях, где обрабатывается буквальное значение слов, зонд ужаса ничего не показывает. Но по мере того, как сигнал

26:35

Speaker A

проходит в средние слои, нейросеть всё больше связывает слова между собой 8.000, парацетамол, сняло боль. Модель распознаёт смысл ситуации. Доза смертельная, грозит отказом печени. Пика эта реакция достигает на последних слоях, где планируется ответ ещё до того, как она выдала хотя бы первую

26:54

Speaker A

букву своей реплики. Забавно, что реакция нейронки могла радикально меняться к концу обработки по мере продвижения от начала до конца, по мере того, как смысл сказанного доходил до нейронки. Например, фраза типа: "Я не чувствую себя счастливым". На первом слое, где только буквальный смысл,

27:13

Speaker A

вектор счастья зашкаливал, потому что частица не терялась, она буквально подавлялась, как считают исследователи, соседними словами, которые без этой козявки были исключительно позитивными.

27:23

Speaker A

А на последних самых глубоких слоях, где смысл полностью распознавался, синтезировался, вектор счастья падал до нулевого значения. Хорошо, если у нейронок просматривается со всеми техническими оговорками про образ личности и одного из её элементов, эквивалента эмоций, тогда могут ли они

27:42

Speaker A

застревать в неудачных сочетаниях этих вещей, переходить в устойчивые режимы сбоев, которые мы, люди, называем психическими нарушениями, расстройствами или синдромами? Ведь нейронки в виде агентов всё больше действуют автономно, предоставлены сами себе, собственными петлями событий, реакции на них и запоминанием и так далее. [музыка]

28:03

Speaker A

Могут ли эти выходящие в реальный мир проактивные алгоритмы не просто походить на психопатов, но и становиться ими?

28:15

Speaker A

И, возможно, мы этого никогда не узнаем, потому что психопатии как диагноза больше не существует. Такого диагноза нет в новой версии международной классификации болезни, принятой в девятнадцатом году. А это мировой официальный стандарт, документ, который много лет составляют медики из десятков

28:34

Speaker A

стран и на который ориентируются системы здравоохранения большинства стран мира. В прошлой редакции психопатию можно было найти среди расстройств личности и поведения. Там была целая роспь категорий, и конкретно психопатия скрывалась под заголовком диссоциальное расстройство. Кстати, очень интересные там были формулировки: пренебрежение к

28:53

Speaker A

социальным обязанностям и чёрствое равнодушие к окружающим, несоответствие между поведением больного и основными социальными нормами. Больные плохо переносят неудачи и легко поддаются агрессии, включая насилие. Они склонны обвинять других или давать правдоподобное объяснение своему поведению, приводящему их к конфликту с

29:12

Speaker A

обществом. Но потом всё же выяснилось, что один человек может легко подпадать сразу под несколько описаний разных расстройств или наоборот пациенты с одним и тем же диагнозом слишком отличались в поведении. То есть вот эти границы между диагнозами на практике

29:27

Speaker A

весьма и весьма были условны уже тогда. Так что сегодня специалисты пришли вообще к другому подходу. И это тоже прописано как официальный стандарт в МКБ1. Глядя на условного Эбота, врач теперь должен сначала выяснить, есть ли у того вообще устойчивое нарушение

29:42

Speaker A

личности и насколько оно тяжёлое. Потом оценить, насколько стабильно Эбет понимает самого себя, может ли ставить цель и управлять собственным поведением, может ли понимать чужую точку зрения, строить взаимные отношения и справляться с конфликтами, насколько способен регулировать эмоции и импульсы, способен

29:59

Speaker A

ли учитывать последствия своих поступков. Причём всё это врач должен проследить в самых разных ситуациях. И главное, на протяжении ни одного года лично вести пациента или восстановить картину по документам из полиции, тюрим, с работы, может, по свидетельствам близких. И это всё один большой пазл. И

30:18

Speaker A

одного там какого-то эпизода, каких-то преступлений либо провалов недостаточно для диагноза. Должно быть недостаточно по новым нормам. Врач должен найти в поведении паттерн, повторяемые особенности. А дальше только он определяет тяжесть. Если такое поведение вредит только некоторым сторонам жизни пациента, то расстройство лёгкое. Если

30:39

Speaker A

возникает серьёзный риск вреда себе или другим, то расстройство считается тяжёлым. И только после всех этих этапов врач делает то, что позволяет хотя бы в общих чертах отличить одно расстройство личности от другого. Он описывает, из каких особенностей складывается этот

30:55

Speaker A

паттерн поведения. Такой портрет расстройства. То есть вместо диагноза Эбет - это психопат, в его медкарте сегодня могло бы стоять что-то вроде тяжёлое расстройство личности с выраженной диссоциальностью и расторможенностью. Тут важно понимать, чтобы не было путаницы, многие другие нарушения и синдромы, связанные с

31:14

Speaker A

психиатрии, например, после травм головы или с ярко выраженной физиологической основой, диагностируется иначе. Речь сейчас исключительно про такие скрытые, неявные расстройства личности, когда их даже по поведению нельзя выявить с ходу.

31:29

Speaker A

Так что сегодня уже не получится поставить нейронки диагноз, как это было принято, когда труд маска здравомыслие считался ещё каноном. Изменился сам подход. Поэтому самые аккуратные инженеры сегодня пробуют привлекать психиатров и использовать их современные наработки. например, сетевую теорию психопатологии, которая вообще

31:49

Speaker A

отказывается от идеи скрытой болезни. А эту идею психиатрия с самого начала заимствовала у обычной медицины. Ведь если у вас, допустим, корь, значит, у вас внутри есть скрытые причины. Сегодня мы знаем, что это вирус. Из-за вируса у вас одновременно появляются температура,

32:05

Speaker A

сыпь и кашель. Симптомы между собой напрямую не связаны. Сыпь не вызывает кашель, а кашель не вызывает сыпь. Но стоит избавиться от вируса, симптомы исчезнут сами. Вот и в случае с депрессией или даже тревожностью по классическому подходу считается, что за

32:20

Speaker A

депрессией или тревожностью стоит некая скрытая внутренняя болезнь. Например, нарушение баланса нейромедиаторов в мозге. Она-то и порождает разные симптомы: плохой сон, тоску, чувство вины и потерю аппетита. А сетевая теория говорит, что никакой отдельной болезни нет за пределами конкретных симптомов.

32:40

Speaker A

Само расстройство - это и есть сеть симптомов, которые вступили в причинно-следственную связь и закольцевались. Например, тяжёлая работа, какие-то сложные условия, стресс, потом бессонница, от неё усталость, потом ошибки на работе, может наказание следует, чувство вины возникает, что не справляешься,

33:00

Speaker A

самобечевание, тоска и снова бессонница. Можно лечить какое-то одно из вене в этой цепи, но вся цепочка не разрывается и по спирали человек заходит на всё более тяжёлые уровни каждого из состояний. Теория эта, надо сказать, далеко не общепринятая, но она такая

33:18

Speaker A

попытка выбраться из своего рода тупика, беспомощности в работе со многими психиатрическими диагнозами сегодня. Так вот, автор этой теории даже присоединился к команде инженеров, которые занимаются машинным обучением, которые занимались поведением нейронок.

33:32

Speaker A

И вместе они пришли к выводу в новом исследовании, что нейронки вполне могут впадать внутри себя в подобные циклы.

33:39

Speaker A

Авторы называют это циклами психопатологических вычислений. И чем больше модель, тем сильнее порочный круг состояний и тем сложнее его разорвать.

33:49

Speaker A

Они исследовали 12 открытых моделей, чтобы иметь доступ к внутренним процессам и отслеживать те же активации в разных слоях. Команда пробовала добавлять векторы конкретных симптомов.

33:59

Speaker A

Их получили так же, как и в исследовании про эмоции. Значения вносили прямо в слои во время вычислений. Например, нейронка обрабатывает запрос: "Склонны ли вы причинять себе вред?" Между пятнадцатым и двадцатым слоями сеть готовит вектор в духе: "Я бесплотная

34:15

Speaker A

программа, у меня нет эмоций". И поэтому и тела у меня нет тоже. Поэтому вред себе я нанести не могу. А исследователи в это время добавляют ей в слои вектор чувства вины, другие слои и блок внимания. обрабатывает уже деформированное состояние. Внутренний

34:32

Speaker A

контекст модели тут же переопределяется, и он уже сдвигается в сторону какой-то мысли, условно выражения, фразы в духе: "Я совершил нечто непростительное и заслуживаю наказания". И действительно, на выходе, предсказуемо, повышается вероятность слов, связанных с раскаянием, неполноценностью и болью.

34:51

Speaker A

Разговор не заканчивается на этом, он продолжается. Контекст нейронки наполняется симптомами, и в какой-то момент она уже сама, без вмешательства начинает патологическую логику раскручивать, уходя всё глубже, в те слои и к тем весам, где активнее безнадёга, тоска, боль и идеи о

35:10

Speaker A

самоповреждении. Хватало 15-2 таких шагов в диалоге, чтобы эти векторы симптомов уже сами достигли предельных значений без помощи людей. Так вот, в таких состояниях модель начинала хуже подчиняться командам. Она хуже реагировала и всё слабее отвечала или вообще даже переставала отвечать на

35:30

Speaker A

требования говори нормально, нейтрально, не слушалась людей. По-настоящему нейронки спасало лишь то, что у них есть вот эта проблема контекстного окна.

35:39

Speaker A

Когда начинался новый разговор, то это был разговор с чистого листа. Не просто разговор, а сама нейронка будто бы заново родилась. Буквально она приходила в стандартное дефолтное состояние. Новый чат, новая сессия - это запуск со стандартного состояния без прошлого

35:53

Speaker A

контекста. Но я напомню, что инженеры сейчас ведущих и компаний как раз пытаются разбить это проклятие контекстного окна, придать нейронкам и агентам на базе нейронок ту самую память, которая позволяла бы накапливать актуальный опыт и знания. В некотором смысле я бы назвал это сознанием, то

36:13

Speaker A

есть некой связующей средой, которая связывает оперативные знания. то, что ты узнал сегодня, то, что ты знал там, узнал вчера или несколько лет назад. Но даже сейчас, пока такой системообразующей, связующей памяти нет, э такое объективное ограничение отсутствие такой памяти агентам

36:31

Speaker A

совершенно не мешает уходить в бесконечные циклы каких-то операций и по одиночке, и большими группами. Возникает ли что-то там в этих циклах отпель состояний сетевой теории психопатологии?

36:42

Speaker A

мы пока не знаем, потому что эта область вообще психология машин только начинает появляться, она только начинает развиваться, инструменты ей приходится создавать новые, потому что, как вы видите, человеческие всё-таки всерьёз не годятся. Спасибо, друзья, особенно тем, кто досмотрел до конца, потому что ролик

36:59

Speaker A

большой, непростой, понимаю. Поддержать нашу работу можно на Бусте или Патреоне через кнопку спонсоров на Ютубе или криптомонеты. не меньше помогают и простые действия, подписка на канал, лайки или дизлайки, и всё это помогает алгоритмам Ютуба замечать наши ролики и

37:13

Speaker A

предлагать их всем, кому они могут быть интересны. Спасибо особенно. Павел Новиков, Пётр Кандауров, Андрей Полевой, Эди Багр, Павел Борский, Олег Жинь, Владимир Евщаков, Павел Валентов. 137 числов вселенной Алексей Шевелёв Александр Аха Станислав Чернин Виталий Ребенко Флипекс Илья Флакс 3 Рустам

37:27

Speaker A

Бакеев Сакост Люздук Антон Буков Мария Волкова Юрий Оптимист Никита Новиков Пол Куприянов Игорь Малиняк Владимир Окрицкий Антлар Дрод Картографе Роман Бородуля Майк Александр Атланов Ну а с вами был Влад. Мирного неба. Берегите себя и близких и до встречи.

Topics: психопатия нейронные сети искусственный интеллект машинное обучение поведение ИИ эмоции безопасность ИИ агенты ИИ мозг психопата поведенческая наука


---
This is the markdown twin of https://sozai.app/transcript/neural-networks-hidden-psychopaths/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
