**VK Видео — смотреть онлайн бесплатно — Transcript & Summary | SozAI**
Source: https://sozai.app/transcript/vk-video-watch-online-free/

Вебинар о идетекторах текста с Никитой Комышниковым, их работе, ошибках и применении в бизнесе и SEO.

## Key Takeaways

- Идетекторы дают вероятностную оценку, а не однозначный вердикт о происхождении текста.
- Ошибки идетекторов могут привести к несправедливым выводам и отказам в оплате или публикации.
- Tex.ru предлагает комплексные инструменты для улучшения и проверки текстов в рунете.
- Признаки ИИ-текстов включают избыточную гладкость, однородность и отсутствие конкретики.
- Поисковые системы могут менять алгоритмы без предупреждения, поэтому важно осторожно использовать результаты идетекторов.

## What the video covers

- Введение и представление гостя Никиты Комышникова, генерального директора Tex.ru.
- Обзор того, что такое идетекторы и как они используются для проверки текстов.
- Обсуждение ошибок идетекторов и почему их результаты не стоит воспринимать как абсолютную истину.
- Принципы работы идетекторов: поиск статистических паттернов и вероятностная оценка.
- Признаки ИИ-сгенерированных текстов, такие как однородность структуры и отсутствие конкретики.
- Рассказ о сервисе Tex.ru и его инструментах для работы с текстами, включая проверку уникальности и SEO-анализ.
- Обзор известных зарубежных и российских идетекторов, включая сервисы GPT Zero, Originality AI и Яндекс Cloud.
- Предостережения о ложных срабатываниях и неправильной интерпретации результатов идетекторов.
- Влияние идетекторов и ИИ-текстов на поисковые системы и рекомендации по правильному использованию.
- Ответы на вопросы и дополнительные пояснения по работе с нейросимволами и инструментами Tex.ru.

## Chapters

1. 00:00 Введение и представление гостя
2. 03:33 Обзор работы идетекторов и их ошибок
3. 06:32 Принципы работы идетекторов и вероятностная оценка
4. 09:52 Признаки ИИ-текстов и их особенности
5. 13:19 Известные сервисы идетекторов и их сравнение
6. 17:23 Особенности российского рынка и Яндекс Cloud
7. 24:00 Проблемы ложных срабатываний и их последствия
8. 29:05 Рекомендации по правильному использованию идетекторов
9. 36:00 Влияние идетекторов на поисковые системы
10. 47:28 Ответы на вопросы и дополнительные пояснения

Answers

## Questions about this video

Что такое идетекторы и для чего они нужны?

Идетекторы — это инструменты, которые анализируют текст на предмет вероятного происхождения от искусственного интеллекта, помогая проверять тексты копирайтеров, SEO-статьи и учебные работы.

Можно ли полностью доверять результатам идетекторов?

Нет, результаты идут с вероятностной оценкой и не являются однозначным вердиктом, поэтому их нужно интерпретировать с осторожностью, чтобы избежать ложных обвинений.

Какие признаки указывают на ИИ-сгенерированный текст?

Такие тексты часто имеют избыточную гладкость, однородную структуру, одинаковую длину абзацев и недостаток конкретики или личного опыта.

## Full Transcript — Download SRT & Markdown

00:01

Speaker A

Всех приветствую. Вы на вебинаре Промопульта. Я Дима Борисов, евангелист Промопульта. И мы сегодня пригласили к вам классного гостя — Никиту Комышникова.

00:11

Speaker A

Он генеральный директор компании Tex.ru. Мы сегодня поговорим про идетекторы. Но прежде чем передать слово Никите, небольшая промовставочка. А, естественно, не могу не воспользоваться ситуацией. А для всех зрителей и слушателей этого вебинара вам QR-кодик с бесплатным SEO-продвижением на 2 недели.

00:28

Speaker A

А в нашем SEO-модуле есть классные инструменты с точки зрения продвижения и помощники, которые семантику соберут, которые продвигать ваши ключевые запросы тоже будут. Так что смотрите, находите там модуль динамического SEO. И также там есть классный удобный см съёмщик позиций. Тоже обязательно используйте.

00:44

Speaker A

По QR-кодику приходите, всё вам будет доступно. Никита, рада тебя видеть, рады тебя слышать. Спасибо, что пришёл в гости. Расскажи нам про идетекторы, как с ними работать, что это вообще такое и как они могут пригодиться нам всем.

01:00

Speaker A

Взаимно. Дима, привет. Рад приветствовать аудиторию нашего сегодняшнего вебинара.

01:09

Speaker A

Давайте сейчас тогда сразу свою презентацию подгружу. Пожалуйста, какой-нибудь плюсик, какое-то подтверждение, что всё хорошо видно.

01:23

Speaker A

Ага, спасибо.

01:44

Speaker A

А, да. Меня зовут Никита Комышников, я генеральный директор Tex.ru — известной и, надеюсь, любимой некоторыми из вас платформы по работе с текстовым контентом. Сегодня поговорим про идетекторы, что они из себя представляют, для чего они нужны бизнесу и нужны ли вообще, как ими правильно пользоваться и можно ли вообще доверять таким инструментам.

02:12

Speaker A

В целом за последние 2 года можно отметить, что идетекторы превратились из такого нишевого IT-инструмента в часть бизнес-процессов, потому что ими проверяют тексты копирайтеров, статьи для блогов, SEO-статьи, учебные работы.

02:36

Speaker A

Но есть такая проблема, что вердикт идетекторов многие воспринимают как такой объективный факт, как по сути результат детектора лжи. То есть если детектор показывает, что текст на 90% написан ИИ, значит человек по умолчанию сжульничал.

02:55

Speaker A

А на самом деле не всё так просто, не всё так однозначно. Наверняка были случаи, когда заказчики отказывали копирайтерам в оплате после того, как проверяли текст на детекторе и получили неудовлетворяющий результат, когда, например, оценки студенту занижались после проверки текста на идетектор,

03:09

Speaker A

либо там какие-то материалы снимались с публикации. В общем, сегодня мы разберёмся, почему этот подход можно назвать опасным, порочным и в целом некорректным.

03:33

Speaker A

А посмотрим, как устроены вообще эти сервисы изнутри, где они ошибаются, в том числе на текстах, написанных живыми людьми, почему так происходит, как правильно пользоваться идетекторами, как правильно интерпретировать их результаты и что на самом деле думают о таких инструментах и о их результатах,

03:46

Speaker A

об их метриках поисковой системы. Собственно, структуру я как раз озвучил. Здесь вот для визуалов она продублирована текстом.

04:11

Speaker A

Перед тем, как перейдём непосредственно к теме моего выступления, немножко ознакомительной части, немножко знакомства. А меня зовут Никита Комышников. Ещё раз скажу, с 2019 года возглавляю проект Tex.ru. До этого возглавлял направление информационных сайтов холдинга Модеска, холдинга, куда, собственно, Tex.ru и входит. А в пике у нас было более 300 информационных сайтов с совокупным трафиком более 100 млн уникальных посетителей.

04:18

Speaker A

А также разрабатывал различные образовательные мероприятия по работе с текстами, выступаю на различных конференциях, форумах, выставках и вхожу в экспертный совет национальной гильдии фрилансеров.

04:34

Speaker A

Также в двух словах про наш сервис Tex.ru. В целом интересно в чате, пожалуйста, поставьте плюс либо ещё какие-то знаки.

04:42

Speaker A

Те, кто хотя бы раз в жизни пользовался сервисом Tex.ru, интересно знать уровень погружения, уровень вовлечённости аудитории.

04:54

Speaker A

А сервис Tex.ru улучшает тексты пользователей через многообразие своих инструментов с 2011 года. А, как видите, из представленных на этом слайде ключевых метрик сервис всё ещё очень популярен, очень востребован.

05:14

Speaker A

Если говорить про разбивку по направлениям, по продуктам, то самое известное наше направление — это проверка текста на уникальность.

05:23

Speaker A

Пожалуй, самая точная, полная и репрезентативная проверка в рунете, поскольку охватывает сразу несколько источников, сразу несколько баз. Это поисковая выдача, это внутренняя локальная база, это отдельные тематические каталоги вроде WBriies и прочих маркетплейсов. И с недавнего времени у нас также появился полный каталог Telegram. Это просто тотальный эксклюзив рынка. Больше такого ни у кого нет. Также у нас есть инструменты SEO-анализа, орфографии.

05:47

Speaker A

Самый крупный в рунете словарь синонимов. С недавнего времени также у нас есть словарь иностранных слов, который поможет проверить перед публикацией, можно ли использовать то или иное слово в рекламных кампаниях на сайте, где-то там в наглядной рекламе.

05:58

Speaker A

И также на Tex.ru есть набор инструментов на базе искусственного интеллекта под общим названием нейропомощник. Собственно, здесь эти инструменты как раз в списках и перечислены. Отдельным блоком вынесен инструмент рерайта неуникальных фрагментов, потому что это отдельная очень классная фича, которая позволяет буквально в несколько кликов за очень короткий период времени повысить уникальность вашего текста, переписав неуникальные фрагменты нейронкой, без потери качества, без потери содержательности, но при этом соответственно с повышением уникальности этого самого текста. А немножко вперёд забегу, скажу, что по ходу вебинара будет небольшой бонус. Также бонус есть в гайде, который вы получили после того, как зарегистрировались на этот вебинар. Этот бонус поможет вам потестить часть нашей продуктовой линейки, той, которая связана с инструментами.

06:14

Speaker A

А начнём с того, как вообще устроены популярные идетекторы и почему их вердикт не стоит воспринимать как однозначный, как очевидный приговор.

06:32

Speaker A

Собственно, если разбирать так по-простому на пальцах, как устроены идетекторы, то они ищут некие статистические паттерны. То есть это предсказуемость следующего слова, это однородность длины предложений, какие-то характерные обороты, которые в человеческих текстах встречаются не то чтобы часто. Вот здесь в качестве примера приведены, важно отметить, нельзя не упомянуть, там, не знаю, в современном мире, исходя из изложенного выше. И по результатам вот этого исследования, сопоставления, идетекторы дают своего рода такую вероятностную оценку. То есть это не однозначный вердикт, а это, как я уже говорил, ни в коем случае не детектор лжи. Это именно такая вероятностная оценка. И это обязательно стоит отдельно проговорить и отдельно отметить, чтобы не создавать ложного ощущения стопроцентной точности работы такого инструмента.

06:51

Speaker A

ИИ-шные тексты с нами уже достаточно давно, уже несколько лет точно. И те, кто с ними давно работает, те, кто в целом по работе или не по работе смотрит много текстов на разных площадках, уже научился без специальных инструментов на глаз определять ИИ-шные тексты и какие-то вот самые очевидные, самые жирные маркеры, которые их выдают.

07:11

Speaker A

Это, в частности, избыточная гладкость и симметрия структуры текста. То есть, если, допустим, везде в тексте ровно там три пункта, если он разбит на списки, а если везде идёт одинаковая длина абзацев, если нет вот этой смены ритма, когда у вас два длинных предложения, потом одно короткое, потом ещё одно длинное, потом четыре коротких.

07:23

Speaker A

А вот если текст слишком ровный, слишком гладкий и слишком ладно скроенный, то это можно считывать как признак ИИ-шности.

07:48

Speaker A

А также подобные тексты выдаёт отсутствие или минимум какой-то конкретики, какой-то фактуры, а детали личного опыта. То есть когда вроде бы текст по теме, вроде бы по существу, но ни о чём. Если из него выжать какую-то статистику, какую-то фактуру, то у вас на деле останется прямо совсем минимум — несколько строчек. Ну и опять же здесь различны вот эти вот...

08:07

Speaker A

однозначный вердикт, а это, как я уже говорил, ни в коем случае не детектор лжи. Это именно такая вероятностная оценка. А и это обязательно стоит отдельно проговорить и отдельно отметить, чтобы не создавать ложного ощущения стопроцентной точности работы такого инструмента.

08:28

Speaker A

А иишные тексты с нами уже достаточно давно, уже несколько лет точно. И те, кто с ними давно работает, те, кто в целом по работе или не по работе смотрит много текстов на разных площадках, уже научился без специальных инструментов на

08:45

Speaker A

глаз определять я иишные тексты и какие-то вот самые очевидные, самые жирные маркеры, которые их выдают.

08:53

Speaker A

Это, в частности, избыточная гладкость и симметрия структуры текста. То есть, если, допустим, э везде в тексте ровно там три пункта, если там он побит на списке, а если вез везде идёт одинаковая длина абзацев, если нет вот этой вот смены

09:14

Speaker A

ритма, когда у вас два длинных предложения, потом одно короткое, потом ещё одно длинное, потом четыре коротких.

09:19

Speaker A

А вот если текст слишком слишком ровный, слишком гладкий и слишком ладно скроенный, то это можно считывать как признак ишности.

09:30

Speaker A

А также подобные тексты выдаёт отсутствие или минимум какой-то конкретики, какой-то фактуры, а детали личного опыта. То есть когда вроде бы текст по теме, вроде бы по существу, но ни о чём. Если из него выжать какую-то, а какую-то статистику,

09:52

Speaker A

какую-то фактуру, то у вас на деле останется прямо совсем минимум несколько строчек. Ну и опять же здесь различны вот эти вот однообразные связки вводные, которые сами по себе никакой ценности не несут, но которые могут по тексту повторяться вроде. Кроме того, таким образом, более

10:09

Speaker A

того и прочее. Такие тексты, они тоже могут свидетельствовать о том, что в их написании принимал участие инструмент на базе ИИ.

10:21

Speaker A

А на какие в целом сигналы опираются детекторы? Здесь выделил четыре основных сигнала. Первый - это перплексия, она же предсказуемость. А языковая модель, она, а, на каждом на каждом шаге чаще всего выбирает самое вероятное, самое предсказуемое следующее слово. То есть те из нас, кто

10:42

Speaker A

помнит и ещё пользуется, может быть, Т9, а, то есть именно в такой логике он работает. Т9 подбирает следующую, подходящую по смыслу слова.

10:53

Speaker A

А нейросети - это, по сути, тот же самый Т9, но многократно прокачанный. Это такая финальная эволюционная стадия покемона. То есть Т9 - это начальная стадия ишный инструмент - это вершина эволюции. А вот поэтому текст получается более предсказуемый. А и это как

11:14

Speaker A

следствие выдаёт то, что он писался с высокой доле вероятностью иишностью, а я иишными инструментами. А живой человек пишет всё-таки более непредсказуемо, более так рвано, более скачкообразно с точки зрения ритма и того, как по тексту может течь его мысль. А следующий пункт

11:34

Speaker A

- это то, что называется. Можно перевести как ритм предложений. А то, что я, в принципе, уже сказал, у живого человека ритм он такой прыгающий, неровный. А бывает длинная фраза с какими-то очень затейливыми оборотами, придаточными, а предложениями, и после

11:55

Speaker A

неё идёт какая-то очень короткая. А модели чаще всего держат какую-то вот какой-то ровный уровень, какую-то однообразную длину предложений.

12:04

Speaker A

А связано с идеей человек человеку свойственно на что-то отвлекаться, ему свойственно упускать мысль, а уходить в какую-то периферическую тему, подтему и так далее. Потом через какое-то время к этой мысли возвращаться. А для иишных текстов такое несвойственно.

12:24

Speaker A

А модель чаще всего очень линейно двигается от одной мысли к другой без потери концентрации, без отвлечения на какие-то другие подтемы.

12:36

Speaker A

А, ну и, наконец, словарный отпечаток. Что здесь подразумевается? У каждого человека есть характерный набор тех слов, которые он чаще всего употребляет, которые он любит употреблять или которые просто уже на подкорке у него отложились. И с другой стороны набор слов и выражений, которых

12:59

Speaker A

он, наоборот, старается избегать. А что касается модели, то они чаще всего тяготеют к более шаблонным конструкциям и повторяющимся паттернам. То есть там нет каких-то какой-то вкусовщины, каких-то предпочтений, но очень много зашито именно на уровне шаблонов. А очень кратко

13:19

Speaker A

укажу список известных сайтов, где можно использовать и детекторы. В основном это зарубежные сервисы GPT Zero, Originality AI, Copelix, Turnin. И здесь среди прочего упомянул а наш сервис оттек.ru, который называется и детектор, который лучше адаптирован для работы с текстами

13:38

Speaker A

на русском языке. Но на этом на этом пункте, на этом инструменте я ещё остановлюсь подробнее чуть позже. На самом деле принципы работы у большинства таких инструментов и детекторов, они а похожи, но точность и пороги бывает отличаются очень сильно. Поэтому а

14:00

Speaker A

всегда рекомендация проверять текст не на одном детекторе, а для большей полноты, для большей репрезентативности данных использовать где-нибудь два-три инструмента.

14:13

Speaker A

Почему вердикт и идетектора не стоит считать приговором? Начнём с того, что детектор он по сути своей работы он находит не вот эту самую искусственность текста, а не избыточную иишность, а его предсказуемость. И что из этого следует? что любой

14:38

Speaker A

предсказуемый текст, даже написанный, а от первого до последнего слова живым человеком, он рискует попасть под под подозрение такого инструмента. Вот сразу первая первая точка риска и первая точка сомнения. А есть очень показательный кейс, когда и детекторы начали появляться,

15:01

Speaker A

начали быть широко представлены в публичном поле, публичном пространстве на уровне доступных инструментов. А их тестировали, в том числе на фрагментах конституции США. И сразу у нескольких популярных инструментов, которые, часть из которых я как раз вам показывал на слайде ранее.

15:23

Speaker A

У них эти тексты из конституции, они были отмечены как написаны нейросетью. Хотя это документ, созданный более 200 лет назад. Да, были какие-то поправки, но даже последняя поправка, она датирована девяностыми годами прошлого века. То есть здесь вероятность того, что ИИИ приложил свою виртуальную руку,

15:45

Speaker A

она полностью исключена. Но вот за счёт того, что а это тексты, которые такие достаточно сухие, написаны по определённым правилам, паттернам и шаблонам, они ошибочно считывались системой как написанные, а нейросетью.

16:00

Speaker A

В 2023 году был такой кейс, что компания Open AI, собственно, самая известная компания, связанная с нейростевыми инструментами технологии, она выпустила свой классификатор, свой детектор и вообще не взлетел, а не потому, что им не пользовались, а потому, что он

16:24

Speaker A

некорректно работал. А Open AI отключил этот инструмент буквально через несколько месяцев, потому что он находил только 26% сгенерированных текстов и при этом ошибочно помечал 9% живых текстов, как и и то есть это очень а большой сбой. Это те показатели,

16:44

Speaker A

которые не тянут ни на какую статистическую погрешность. И это показатели, которые не дают возможности, не дают никакого морального и иного права большой уважающей себя компании выпускать его в рынок. Вот, кстати, да, повод для того, чтобы подумать, почему ни один из крупных, ни один из биктеch

17:05

Speaker A

проектов, ни один из гигантов ниши AI до сих пор не выпустил свой идетектор? То есть чаще всего детекторы выпускают какие-то компании поменьше. А, а вот на слуху прямо сейчас нельзя сказать, что я пользуюсь идетектором от Opena Aa или от

17:23

Speaker A

Antropic или ещё от какой-то компании. А если перенести это на российский рынок, то, например, у компании Яндекс, Яндекс Cloud, если быть конкретнее, у них есть свой идетектор, но они его не то чтобы очень активно продвигают, то есть он

17:38

Speaker A

где-то есть на заднем плане, а, но когда дело доходит до каких-то презентаций, до активных рекламных кампаний, этот продукт, этот инструмент всегда находится где-то, а, на задворках.

17:51

Speaker A

А, и последний пункт, последняя строка на этом слайде, даже лучшие, даже, э, наиболее исправно работающие современные инструменты, современные идетекторы, они в идеальных условиях не могут гарантировать стопроцентную надёжность.

18:07

Speaker A

То есть это в лучшем случае где-то 60-80%. Это всегда стоит держать в уме и принимать во внимание. А, то есть какой основной вывод следует из вот этого блока? То, что процент, показанный по итогам детекции текста через специальный инструмент, его стоит воспринимать

18:31

Speaker A

не как истину в последней инстанции, не как вердикт, не как приговор, а как сигнал для каких-то дальнейших действий, для дальнейшей проверки, для дальнейших вопросов к тому, кто этим текстом занимался. по поводу того, какими, а, инструментами какими э какими

18:49

Speaker A

каналами этот текст вообще получался. А, немного поговорим о ложных срабатываниях. Почему может быть такое, что текст живого человека считывается и детектором, как иишный?

19:06

Speaker A

И здесь сразу интересная цифра, сразу интересный кейс. А двадцать третий год большое исследование на а инструментах и детекции того времени, наиболее передовых для 2023 года в качестве предмета для исследований. А были взяты работы студентов, проходивших тест TOF. Ну, все наверняка знают, что это

19:36

Speaker A

такое. Это самый известный, самый популярный международный тест на знание английского языка. А, с уточнением английского языка как второго, то есть как неродного.

19:47

Speaker A

А может быть у вас, пока я завершаю эту мысль и перехожу к следующему слайду, есть какие-то догадки, какие-то мысли, почему тексты, а, проходившие вот это тестирование, они почти полностью были отмечены как, э, написаны ИИ. Хотя, а, достоверно известно, что это всё тексты, которые

20:09

Speaker A

писали люди. То есть здесь вариант сжульничать или вариант того, что это баг системы какой-то случился, он полностью исключён.

20:21

Speaker A

Версий пока нет, поэтому перейду к следующему слайду, где как раз будет ответ по итогам вот этого вот Стэнфордского исследования.

20:31

Speaker A

А ответ заключается в том, что тексты написанные, а не на родном языке, то есть, да, ещё раз скажу, это тестирование проходили люди, для которых английский язык - это второй, не не найтивы. А такие тексты, они, как правило, а гораздо более

20:48

Speaker A

простые, более скупы, с более предсказуемой грамматикой, характерны для, а, для как раз-таки второго языка неродного.

20:59

Speaker A

И здесь видим дополнительную статистику, то, что, а, средний FPR, то есть коэффициент ложноположительного срабатывания таких текстах составлял 61,3%.

21:13

Speaker A

Это это очень существенные а существенное значение. Также под подозрение, под такое вот ложное срабатывание могут попасть тексты после, а, после автоматических редакторов, после автоматических перевозчиков, таких какли и прочие аналоги. Потому что такие сервисы, такие инструменты, они сглаживают синтаксис, они, а, как-то

21:40

Speaker A

упрощают текст, делают его более более предсказуемым, более понятным, более простым. И как раз-таки они утрамбовывают текст таким образом, что он потенциально может выглядеть как написанный нейросетью в первую очередь по структуре. То, что мы ранее с вами проговаривали, а ровная длина

22:01

Speaker A

предложений, ровное количество пунктов и всё остальное. А также под ложные незаслуживающие подозрения могут попадать тексты отдельных тематик, отдельных направленностей. Это такие более, а, более канцелярские, более сухие, более казённые тексты.

22:23

Speaker A

Например из тем, из тематики юриспруденции, где особенно, а, словом и образом и прочими там визуальными аа словесами не разгуляешься. А у нас, например, в в период работы направлений инфосайтов для текстов, относящимся к юридической тематики, к юридическим сайтам, даже

22:47

Speaker A

были отдельные требования по уникальности, по, а, прочим метрикам и характеристикам, потому что мы понимали, мы отдавали себе отчёт, что в юридических текстах очень сложно сделать высокий процент уникальности, так как они часто отсылают, часто, а, берут информацию из каких-то официальных

23:06

Speaker A

государственных документов, это там кодексы, конституция, ещё всё остальное. А переписывать в вольном стиле, рейтить фрагменты гражданского кодекса, это, ну, совсем совсем не годится.

23:23

Speaker A

И также, э, под ложноные подозрение и и детекторов потенциально могут попасть, а, более короткие тексты. Это особенно тексты, которые, а, насчитывают по своему объёму менее 1.000 знаков. Здесь следует простое правило: чем меньше по объёму текста, тем меньше статистики для

23:43

Speaker A

анализа и тем, а, выше потенциальная погрешность алгоритма. немножко цифр посреди букв на отдельном слайде для того, чтобы описать масштаб проблемы, масштаб вот этого бедствия на конкретных цифрах.

24:06

Speaker A

А, конечно, сейчас модели и детекторы работают гораздо более точно, более корректно и исправно, чем это было, например, в двадцать третьем году, на результаты тестирования которого я по ходу выступления ссылался.

24:24

Speaker A

Тем не менее, даже если мы говорим о заявленной точности в 99%, казалось бы, высокая точность, которую стоит доверять, а она всё равно оставляет 1% ложных срабатываний. И если взять масштаб, допустим, 75.000 ся проверенных работ. Это значит, что 750

24:48

Speaker A

из них, это как раз 1%, а они выдают ложные результаты. А каждый такой ложный результат, каждое ложное срабатывание - это потенциально ложное обвинение для для того, а кто этот текст сдал на проверку или проверил для себя или какой-то иной сценарий

25:10

Speaker A

произошёл. А у разных инструментов реальный вот этот вот процент ложно-положительного срабатывания, а сильно отличается от заявленного. А некоторые независимые тесты показывают десятой доли процента. Где-то там счёт идёт уже на, а, целый, на единице процента. А у некоторых открытых моделей

25:37

Speaker A

бывает такое, что, а, ложноположительное срабатывание доходит до там, не знаю, 30-40%. Это ну совсем уже совсем уже перебор. Понятно, что средняя цифра, она сейчас всё равно больше вот к 1% э относится. Тем не менее, это опять же ещё один, а, ещё один сигнал, а, в

26:02

Speaker A

сторону того, что к результатом и детекторов не стоит подходить однозначно и воспринимать эти цифры и эти результаты как а некую аа некую инструкцию, некую методику для дальнейших действий без какого-то погружения в а нюансы.

26:28

Speaker A

Далее разберём, что вообще с этим делать бизнесу, как правильно проверять контент через идетекторы, как, я бы даже сказал, как правильно интерпретировать результаты, полученные через идетекторы.

26:43

Speaker A

Здесь несколько пунктов. Аа первый пункт, он, по сути суммаризирует и повторяет то, что я уже озвучивал ранее. Не стоит никогда принимать никакие, э, кадровые решения либо какие-то ещё иные, исключительно на основе одного вердикт детектора и аа если вы, допустим,

27:07

Speaker A

работаете с копирайтером, редактором, контентмаркетологом, кто-то, кто пишет вам тексты для ваших площадок, а, и вы засекли его на, а, высоком проценте и детекции, Хотя изначально вы там проговаривали, что это обязательно должен быть рукописный текст, то получив такой результат,

27:29

Speaker A

опять же, не рубите с плеча, включайтесь в диалог, а дайте автору, исполнителю, работавшему над этим текстом, право на на диалог, на ответную реплику. Он может там показать историю своих правок в Google документах. Такое возможно. а, какие-то черновики промежуточной версии,

27:53

Speaker A

и это может быть гораздо весомее, чем те цифры, которые вам в итоге выдал и детектор.

28:00

Speaker A

Также обязательно стоит учитывать контекст, а, того текста, который вы получили, потому что здесь может быть несколько поводов, э, снижения доверия к результату. Это, а, собственно, тематика, то, что мы ранее уже обсуждали с вами, а, которая не подразумевает живых, ярких и, а, пёстрых по содержанию

28:25

Speaker A

текстов. Это может быть очень короткий текст, это может быть иное обстоятельство которое а позволяет которое накладывает определённый отпечаток при а при оценке, при рассмотрении результатов и и детектора.

28:41

Speaker A

Ну и как некая рекомендация установить внутренний регламент в своей компании по поводу того, как работать с и детекторами, с какого значения стоит рассматривать тексты, как потенциально а с какого порога стоит э рассматривать тексты как требующие э ручной проверки

29:05

Speaker A

редактором, как требующие изучения там истории правок. истории вообще написания этого текста, а не, э, скатываться сразу к автоматическому отказу, к к автоматическому непринятию этого текста.

29:23

Speaker A

Ещё более структурно, системно постарался зафиксировать это на отдельном слайде. Пять правил проверки контента. В первую очередь смотрите на а процент вероятности, не на какой-то вот бинарный вердикт: "Да, нет, человек нейросеть".

29:45

Speaker A

То есть, если вы получили текст с результатом 20-30%, то это не стоит воспринимать по умолчанию как текст от и, это стоит считывать как сигнал. А какой-то категоричный вывод, он может быть уместен только при явно высоких значениях, то есть, а когда получаете

30:08

Speaker A

тексты, там 100% и и при различных дополнительных признаках, на которые тоже ранее обращали внимание, это шаблонные фразы, это отсутствие какой-то фактуры, отсутствие личного опыта.

30:24

Speaker A

А если текст в основном состоит из каких-то водных, вводных и водных конструкций, если там очень мало пользы, если там встречаются какие-то нестыковки с точки зрения фактчекинга, то это уже гораздо более существенный, более серьёзный сигнал, чем оценка и детектора.

30:49

Speaker A

А не стоит уповать на один инструмент. В целом это правило, которые универсально для работы с любыми инструментами. Лучше пользоваться несколькими, чтобы смотреть разные показатели, разные значения. А это актуально может быть и то есть это правило, которое ещё к

31:09

Speaker A

журналистике идёт получить подтверждение из трёх источников. Вот здесь тоже рекомендую смотреть результаты по разным детекторам. Да, там могут быть различия, потому что разные детекторы, они обучены на разных данных. У каждого могут отличаться алгоритмы, ошибаются, соответственно, они тоже по-разному, но совпадения они совпадения

31:33

Speaker A

всё равно случаются. И совпадение оценок двух-трёх сервисов, оно, а, в любом случае повысит доверие к результату.

31:43

Speaker A

Учитывайте длину текста обязательно, потому что короткие тексты, как я уже говорил, проверяются менее точно. И далее по ходу презентации у меня как раз будет будет несколько примеров наглядных. А, смотрите на стиль и жанр, потому что, опять же, повторюсь,

32:00

Speaker A

техническая документация, юридические тексты, бывает, что SEO-тексты, которые написаны по очень жёсткому, не предполагающему каких-то отклонений техническому заданию, они чаще дают ложное срабатывание. И это можно назвать некой, а, некой скидкой, некой поправкой на стиль и жанр.

32:23

Speaker A

и используйте и детектор как начало разговора с исполнителем, с автором, а не как его финал, а высокий процент и детектор повод спросить копирайтера, там, контент-маркетолога и нового исполнителя о процессе работы, а не сразу, а, накладывать на него какие-то какие-то санкции.

32:46

Speaker A

И здесь я органично перейду к нашему инструменту и детектор текста от текru. А наш инструмент позволяет проанализировать повторяемость слов и фраз, найти вот эти самые шаблонные конструкции, которые чаще всего грешат яишные тексты, и выдаёт результат проверки в процентах.

33:10

Speaker A

А почему я на этом отдельно остановился? Потому что есть и детекторы, которые, а, ограничиваются оценками без каких без указания цифр и значений и вероятностей.

33:22

Speaker A

То есть они просто пишут, что этот текст, скорее всего написан человеком. Этот текст, по всей вероятности, написан и и у нас всё-таки конкретные цифры, конкретные значения. А по долгому периоду использования, эксплуатации этого инструмента, могу сказать, что он хорошо работает с

33:42

Speaker A

текстами от разных нейросетей. По объёму он вмещает в себя до, а, 50.000 символов. То есть можно сразу целый какой-то лонгрид, какую-то учебную работу загрузить и проверить её на, а, потенциальный иишный след. А также, если для вас актуально проверять тексты в большом объёме, с

34:05

Speaker A

минимальным вовлечением на уровне ручного труда, с делегированием автоматики, то есть возможность подключения этого инструмента по апи. И если вы, а, уже работаете, вы как бизнес или как частное лицо уже работаете с экосистемойте, с нашими различными инструментами, то проверка от проверка на идетекцию, она

34:30

Speaker A

встраивается в в тот же процесс, что и, например, там проверка уникальности, проверка а на орфографию.

34:37

Speaker A

и несколько примеров, собственно, работы нашего и детектора, в том числе и варианты ложного срабатывания, чтобы быть честным. Далеко не ходил за примерами. Первый пример взят из нашего раздела новостей.

34:55

Speaker A

Очень короткий текст, очень сухо написанный. Цель этого текста просто предупредить пользователя о том, что ожидаются технические работы и сайт может быть недоступен.

35:07

Speaker A

А, как видите, этот текст наш детектор пометил как на 100% сгенерированный Ии, хотя это не так. Это текст, который писался человеком, либо взят шаблон из ранее написанной человеком заготовки для новости. Тем не менее, а, и в этом тексте вовлечён не был. А это как раз

35:31

Speaker A

примеры того, что может срабатывать ложно. Другой вариант, здесь вдохновившись примером 2023 года, как специалисты Стэнфордского университета исследовали работу и детектора на американской конституции, взял кусок из российской конституции, которая тоже не сказать, что очень увлекательна и разнообразно по своему

35:56

Speaker A

содержанию. То есть это тоже больше такой сухой, официальный справочный текст. И как видите, здесь тоже аа налицо ложно положительное срабатывание.

36:07

Speaker A

То есть 97,9% э этого фрагмента наш инструмент обозначил как потенциально иишный. Вот удивительно, что 97,9, да, вот 21 - это какое-то место человеку нашлось. То есть, видимо, посчитал, что статья пять - это написано человеком.

36:29

Speaker A

А здесь уже третий пример уже не такой, а, не такой однотонный. Здесь я специально взял кусок новости с сайта RIA.ru. Ри новости, а, одно из самых известных информагентств, где, если говорить именно про новости, тоже не особенно не особенно изобилуют тексты чем-то

36:53

Speaker A

таким, а, живым, красочным и ярким. То есть это, как правило, тоже такое как от советского информбюро.

37:01

Speaker A

И здесь видим, что, э, текст отмечен уже не так однородно, что это 100% и это 0%. И а здесь уже с некой вероятностью отмечено, то есть 21,9% инструмент отметил как текст с высокой долей вероятности, написанной человеком, но тем не менее какие-то вот следы,

37:25

Speaker A

какие-то признаки и и содержащий. Ну и для контрастного совсем примера взял текст из Telegram-канала textr.ru.

37:38

Speaker A

Подписывайтесь, кстати, если ещё этого не сделали. А текст совсем другой направленности, совсем другого содержания. Здесь мы очень кратко напоминаем в формате чек-листа нашим пользователям, что такое уникальность текста, кому и для чего она нужна.

37:52

Speaker A

Здесь, в принципе, уже невооружённым глазом по всяким смайликам, эмодзи и всему прочему видно, что текст написан человеком. И, собственно, наш ИИИ детектор это всё подтвердил. То есть никакого даже намёка на и след он здесь не обнаружил.

38:10

Speaker A

И, э, ещё один слайд буквально сегодня я добавил. Картинка, которая попалась мне, на самом деле, в одном а мемном Telegram-канале, но она оказалась очень к месту. А в тему ложноположительных срабатываний пользователь проверял через один из инструментов фрагмент логика философского трактата.

38:35

Speaker A

Я прочитаю, чтобы не ошибиться. Людвик Витгенштейн. Мир есть всё, что имеет место. Вот так называется этот трактат.

38:43

Speaker A

Написан он был в десятые годы 20дца века. по структуре, как видите, он очень похож на шаблонные иишные тексты, потому что он, а, это просто, по сути, список, где где сам текст тоже очень сухой, очень скупой, где по содержанию, по длине

39:06

Speaker A

своей, по объёму, по структуре очень похожи все пункты, и поэтому, э, инструмент ошибочно считал его как на 100% написанный искусственным интеллектом.

39:22

Speaker A

Бонус, собственно, как вы можете протестировать наш инструмент и детектор и любой другой инструмент из всей линейки нейропомощник, если что-то более актуальное, не затрачивая при этом своих денег. А, Дима, я вижу, ты включился, а у меня ещё не всё. У меня ещё ещё один блок остался

39:43

Speaker A

по после Без проблем. Без проблем. После промокода, а промокод детектор активируйте в своём профиле в textru.

39:51

Speaker A

25.000 нейросиво вам начислится. Можно использовать как для нового аккаунта, так и если у вас уже есть зарегистрированный аккаунт на сервисете.ru.

40:00

Speaker A

И, наконец, мой финальный тематический блок, который называется Что думают поисковики об и контенте? Практически формулировка как мечтают ли андроиды об электроовцах.

40:13

Speaker A

Тут важно сразу снять тревогу. поисковые системы не используют те же идетекторы, которые вот доступны а в интернете нам как пользователям, то есть не используют те же детектор, что и бизнес, и не а штрафует, не накладывает какие-то серьёзные санкции на сайт за

40:34

Speaker A

сам факт использования и и текстов. А, конечно, как и во всём нужно знать меру.

40:39

Speaker A

Если вы только запустили какую-то площадку и тут же её, а, залили ишными текстами, то в моменте может быть какой-то буст, может быть какой-то хороший трафик, но в перспективе вы встретите незавидную судьбу и незавидную участь в виде различных санкций,

40:55

Speaker A

блокировок и других мер со стороны Google и Яндекс. А в чём заключается позиция Google по отношению к и контенту? Официально формулировка выглядит э вот она вынесена в, а, фрагмент слева, она звучит как качественный контент. То есть мы вознаграждаем высококачественный

41:15

Speaker A

контент вне зависимости от того, каким образом он был создан. Главный критерий - это, а, вот это самый их известный и EAT экспертность опыт авторитетность доверие. И, э, главный критерий, чтобы текст отвечал на интент, на реальный запрос пользователя, а не, э, и без

41:36

Speaker A

особого различия, каким инструментом было написано: человеком, нейросетью, либо как-то вот в коллаборации. А что касается спама, то как спам может трактоваться текст, который просто вот набит ключевыми словами без особого упора на смысл. Это примерно так выглядели старые SEOтексты

42:01

Speaker A

времён более дикого состояния рынка прошлого десятилетия. Некоторые ещё до сих пор такие выпускают. Также, как спам, может квалифицироваться массовый автогенерируемый контент без какой-то постредактуры или корректры.

42:15

Speaker A

Это может быть там, не знаю, автоперевод, это рерайт чужого контента без добавочной ценности, без добавления туда какой-то вот своей фактуры и чего-то дополнительного. А, и как вывод забыл сказать, Google в целом как сущность не запрещает и жёстко не

42:36

Speaker A

регулирует и контент, по крайней мере сейчас, но борется с масштабированным низкокачественным контентом, который создан исключительно ради манипуляции выдачей, трафиком и другими показателями. А что касается Яндекса, то здесь сложнее оказалось найти его публичную позицию по поводу еконтента.

42:56

Speaker A

То есть формально какого-то публичного запрета Яндекс не вводил. И в целом позиция выглядит, наверное, так такой же мягкой, может быть, даже чуть мягче, чем у Яндекса. это акцент на, а, инструменте оригинальные тексты и общих поведенческих качественных факторах ранжирования, а не на определении

43:19

Speaker A

способа создания текстов. А на практике же SEO специалисты наблюдают рост позиций у, важно отметить, качественного и контента, то есть того контента, который не сразу после генерации ушёл в публикацию, а который прошёл пост обработку на уровне там редактуры, корректры от живого человека.

43:46

Speaker A

А, и всё-таки стоит немножко предостеречь от вывода, что Яндекс всё разрешает и допускает. А потому что, ну, все мы знаем, что у Яндекса механизмы, алгоритмы, они могут резко меняться без публичных разъяснений, как это бывало с некоторыми их другими алгоритмами.

44:11

Speaker A

А если обозначить вывод по итогам прошлого блока, то оба поисковика в итоге смотрят на полезность и качество контента, особенно не выделяя какой-то конкретный источник получения этого контента как более желательный или как менее желательный.

44:28

Speaker A

И сам по себе инструмент и инструмент в работе над текстом - это не а не фактор риска, а фактор риска - это, собственно, бездумная работа с этим инструментом и отсутствие редактуры, фактчекинга и прочих важных параметров.

44:43

Speaker A

А какие выводы по итогам всего всего доклада можно обозначить? И детекторы измеряют э не сам факт авторства текста, а его уровень предсказуемости. Вердикт и детектор - это, а, вероятностный сигнал, а, но не истина в последней инстанции и не какой-то

45:04

Speaker A

итоговое доказательства. Ложное срабатывание и детектора могут происходить, это не редкость. Я вам конкретные примеры показал, что может учитываться ложно, как яичный текст, особенно если это какие-то короткие тексты, либо тексты более справочного содержания по сложным сухим темам, которые не предполагают

45:27

Speaker A

полёта мысли и речи. А а если у вас короткий текст по юриспруденции, то это, соответственно, двойной фактор риска.

45:37

Speaker A

А правильная проверка - это когда вы используете несколько инструментов, находите какие-то, а какие-то сходящиеся результаты по нескольким инструментам, а, внимание к процентам учёт контекста вместо очевидного однозначного вердикта.

45:55

Speaker A

Ну и, наконец, поисковики прямо сейчас не не наказывают за факт использования и а здесь гораздо важнее польза и качество текста для для читателя.

46:06

Speaker A

без какой-то сегрегации, без какого-то разделения на каналы этого контента получения. Собственно, как финальная практическая рекомендация для бизнеса, для частных лиц, которые работают с текстом контентом, что строить внутренний регламент проверки контента стоит не, а вокруг вопроса написан текст нейросетью. И если нейросетию, то в

46:32

Speaker A

каком в какой пропорции, а вокруг э вопроса, вокруг основного пункта, насколько это текст закрывает пользовательский запрос, насколько он полезен читателю, насколько он точен фактически.

46:46

Speaker A

в этой картине мира, в этой парадигме и детектор лишь один из инструментов, который может вам помочь, но при а не очень разумном, не очень вдумчивом и корректном использовании, он может навредить. Поэтому используйте и детектор с умом, с пользой.

47:07

Speaker A

Ещё раз покажу промокод, который поможет вам потестировать наш инструмент детекции и любой другой инструмент из набора наших нейропомощников. Поэтому, пожалуйста тестируйте задерживайтесь как регулярный пользователь, будем очень рады.

47:28

Speaker A

На этом с повествовательной частью у меня всё. Большое спасибо за внимание. Видел, что в чате были какие-то вопросы.

47:34

Speaker A

Внизу есть QR-код. Если что, этот QR-код ведёт на на меня в Телеграме. Если будут какие-то дополнительные вопросы, комментарии, какая-то обратная связь в отложенном формате, которую ещё не готовы озвучить сейчас или там потом какое-то озарение придёт, пожалуйста, связывайтесь, я с удовольствием

47:52

Speaker A

пообщаюсь. Никита, спасибо. Шикарный ликбес о том, что и сигналы требуют критического анализа непременно, потому что вслепую верить им всё ещё нельзя. Давай по пройдёмся по вопросикам. А Сергей спрашивает про то, распознаёт ли ваш инструмент Квен? Я думаю, очевидно, да.

48:16

Speaker A

Да, да, я думаю. А здесь здесь здесь я сразу скажу, что вот список того, что распознаёт наш детектор у меня на слайде, он был не максимально исчерпывающий, а просто вот самую самую базу взял, самое основное, что проверяют. А так он, конечно, да,

48:32

Speaker A

охватывает гораздо большее количество нейросетей. Сергей также спрашивает: "Несколько важно для SEO, чтобы текст был написан 100% без ИИ?" Я бы не сказал, что прямо вот на на 100% без и - это одно из ключевых требований для сеошных текстов. То есть здесь опять

48:51

Speaker A

же я вернусь к к своему выводу, к своей прописной истине, что, ну, можно использовать яишный тек можно допускать участие и инструментов в работе над текстом, а, и на SEO показателях это отрицательно не складыва не не сказывается, но опять же, э,

49:15

Speaker A

на финальном этапе работы над текстом в любом случае должен находиться человек, который проверяет этот текст на, аэ, на уникальность, на фактчекинг, а на аэ иные иные параметры, на ошибки и всё прочее. Вот. То есть, э, нет, так, по

49:32

Speaker A

крайней мере, я не знаю, э такого правила, чтобы сеутексты они требовали вообще исключения какого-то и исследов.

49:45

Speaker A

Соглашусь. А ещё один вопрос. Наталья спрашивает: "Для художественных текстов подойдёт ваш детектор?" И да, на самом деле он подойдёт для для любых текстов, потому что если там заглянуть в историю его использования, то какие только жанры тематики и форматы

50:04

Speaker A

через него не проходили. В художественных текстах, казалось бы, а вероятность вероятность какого-то и и следа, как настоящего, так и ложноположительного, вроде бы поменьше.

50:16

Speaker A

Но, может быть, так, не знаю, для, а, для самоуспокоения можно посмотреть. Опять же, вот я говорил, что если текст э написан по очень такой ровной структуре, очень сухим языком, то он может быть ошибочно считан как. И здесь вы можете просто вот себя проверить,

50:33

Speaker A

что, а если у вас там, а, немножко суше стал стиль изложение, то вот это может быть, ээ, зафиксировано как некая некая потенциальная иишность. То есть, ну, как на уровне самопроверки, да, вполне.

50:50

Speaker A

Так, тоже по инструментарию, по-вашему. Нейросимволы у вас это просто символы или токены? Так. Нейросимволы - это такая своего рода внутренняя валюта наша. То есть здесь нет такого сочетания, что один нейросимвол равно один одна буква, один знак текста. А здесь

51:14

Speaker A

несколько иная система. И скорее, да, это можно назвать токенами. И, э, когда вы какой-то текст закидываете в тот или иной наш инструмент, то в режиме preview мы в любом случае показываем, сколько нейросимволов будет списано. И а не будет такого, что с вас списалась

51:33

Speaker A

какая-то вот вообще какое-то не неведомое, не непонятное значение. То есть там на на уровне формул всё всё чётко работает.

51:44

Speaker A

Никит, от себя ещё вопросик задам. А чисто твоя оценка такой применительной практики. Условно есть проект, на котором работало несколько команд. Вот у них, например, информационный раздел свой есть. А, и компания решила посмотреть в сторону GO или Геопродвижения, там, кому как угодно

52:01

Speaker A

называется. Вот. И мы в своей практике постоянно рассказываем, что нужно оценивать свой контент с точки зрения, притрагивалась там нейросеть, кто-то там тестировал, баловался неросетками по написанию контента. Вот с этой точки зрения насколько подходит ваш инструментарий, чтобы быстро пройтись по

52:17

Speaker A

таким текстам, посмотреть, какие из них прямо тупо и грубо там сгенерированы при помощи нейросетей, которые могут подпадать под дальнейшую дооптимизацию, например, или переписание.

52:28

Speaker A

Да, здесь вполне подходит. А, и немножко вот забегая вперёд, проспойлерю один наш скорый релиз, инструмент, который может быть ещё более релевантен. Вот такие запросы вообще по всё, что связано с с Geoо, у нас готовится к релизу уже где-то прямо на финальных этапах

52:49

Speaker A

тестирования инструмент геоанализатор. А вот он как раз по ещё большему количеству критериев прогоняет тексты. И вот для подобного запроса он будет очень очень к месту.

53:02

Speaker A

Отлично. И последний вопросик Елена задаёт. А было заявлено, что на сайте у вас указано, что может инструментарий проверить не только на и, но и улучшить его. Как ты можешь это прокомментировать?

53:14

Speaker A

Да, здесь у нас уже есть просто готовая готовая рабочая связка из двух инструментов. Это собственно после того, как вы проверяете текст на и детектор, а находится какой-то вот объём, э, который инструмент пометил как яишный. А, и после этого, чтобы и на самом деле, даже

53:34

Speaker A

если не находит, если если в целом текст такой который ну в котором недостаточно жизни и эмоций, хотя должны они там быть, для этого у нас есть инструмент, который называется гуманизатор. Это инструмент, который берёт яишный текст и как-то и раскрашивает его. В общем,

53:53

Speaker A

делает более человекоподобным, более живым, ярким и интересным. И, соответственно, если этот текст проверять через детектор, то он уже фиксируется с гораздо меньшим процентом потенциальной и детекции. То есть не всегда это ноль, но в любом случае меньше. И по

54:13

Speaker A

уникальности этот текст, э, то есть процент уникальности этого текста, он, как правило, тоже очень высокий. Вот. То есть, а, связка и детектор плюс гуманизатор, она у нас уже просто образовалась как такая наиболее рабочая из всего, что, а, в блоке

54:28

Speaker A

нейропомощника используют наши пользователи. Супер, супер. Никит, вопросиков больше нет. А тебе огромное спасибо, что пришёл в гости. Я лично лично думаю, что Да, ты пришёл, потому что я как человек, который текст.ru для себя открыл ещё лет 15, может, на, ну, очень давно. Очень

54:48

Speaker A

давно. Поэтому мне лично очень приятно видеть тебя в гостях. Ребята, у нас в гостях был Никита Камышников, генеральный директортек.ru.

54:56

Speaker A

Спасибо вам всем за внимание. Обязательно приходите к нам вра вебинары. Ещё всем пока. Спасибо. Пока. У

Topics: идетекторы Tex.ru проверка текста уникальность текста SEO-продвижение ИИ тексты копирайтинг вебинар искусственный интеллект анализ текста


---
This is the markdown twin of https://sozai.app/transcript/vk-video-watch-online-free/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
