Обзор локальной RAC-системы AnythingLLM для работы с документами и файлами без загрузки в облако.
Key Takeaways
- RAC-технология позволяет интегрировать языковую модель с локальными данными для удобного поиска и анализа.
- AnythingLLM работает с целыми директориями, сохраняя привычную структуру хранения файлов.
- Система полностью локальная и open source, что обеспечивает конфиденциальность данных.
- Поддерживается множество форматов документов и файлов, что расширяет возможности использования.
- Для точного поиска иногда требуется уточнять запросы, но есть настройки для улучшения результатов.
What the video covers
- Современные AI-чаты широко используются, но отвечают только на основе обучающих данных или интернета.
- Проблема: как получать ответы на основе собственных документов и данных, хранящихся локально.
- Технология RAC (Retrieval Augmented Generation) позволяет связать языковую модель с локальными источниками данных.
- AnythingLLM — удобная open source платформа для работы с языковыми моделями и локальными файлами и директориями.
- Система позволяет задавать вопросы на естественном языке и получать ответы с ссылками на исходные файлы.
- Поддерживается работа с разными форматами: PDF, текстовые файлы, Markdown, документация, конфигурации и др.
- Рассмотрены примеры поиска информации в документах, счетах, гайдлайнах и Docker-конфигурациях.
- Важное преимущество — полная локальная работа без передачи данных в облако, что повышает безопасность.
- Видео включает демонстрацию интерфейса AnythingLLM и примеры запросов к локальным данным.
- Даны рекомендации по установке и настройке системы для локального использования.
Chapters
- 00:00Введение и проблема работы с AI на основе собственных данных
- 01:30Описание технологии RAC и её преимущества
- 04:00Преимущества локальной системы и безопасность данных
- 07:00Особенности AnythingLLM и работа с директориями
- 08:30Демонстрация работы с тестовыми документами
- 15:00Примеры запросов и поиск информации в документах
- 15:30Поиск пароля в Docker compose файле и уточнение запросов
- 16:05Обзор необходимых компонентов и установка системы
Full Transcript — Download SRT & Markdown
Speaker A
Сегодня AI-чатами никого уже не удивишь. Мы можем задавать вопросы, получать объяснения, писать тексты, генерировать код и решать множество повседневных задач. Но есть одна важная проблема.
Speaker A
Любая языковая модель отвечает либо на основе данных, на которых она была обучена, либо используя информацию, которую может найти в интернете. Для большинства задач этого вполне достаточно. Но что делать, если мы хотим получать ответы на основе наших собственных
Speaker A
данных? Например, у нас есть документы, инструкции, проекты, какие-то страховые полисы, техническая документация. Конечно, можно каждый раз вручную загружать нужный PDF-файл в чат и просить модель его проанализировать. Но когда документов сотни или даже тысячи, такой подход
Speaker A
становится просто неудобным. Особенно, если часто информация хранится не в PDF, а, например,
Speaker A
в текстовом файле, Markdown-файле, просто какая-то документация к проекту или какой-то файл находится где-то на вашем компьютере либо на сервере. Именно здесь на помощь нам приходит технология RAC — Retrieval Augmented Generation. Если говорить простыми словами, она позволяет связать языковую
Speaker A
модель с вашими источниками данных. В нашем случае такими источниками будут документы и файлы. После настройки мы сможем задавать вопросы обычным языком. Например, покажи все счета за
Speaker A
2025 год. Подготовь краткий обзор документации проекта, найди информацию по определённому
Speaker A
сервису или скрипту, ну и так далее. Примеров очень много. Всё зависит от вашего юзкейса.
Speaker A
И самое важное — это всё без необходимости вручную искать нужный файл. Нам система будет показывать ту информацию, которую мы запросили, и также будет давать ссылку на тот файл, в котором она нашла эту
Speaker A
информацию. Есть также ещё один важный момент. Многие не хотят загружать свои личные документы
Speaker A
в облачные сервисы и передавать их сторонним компаниям для анализа. Поэтому мы построим
Speaker A
такую систему полностью локально на собственном компьютере. И данная система полностью open source
Speaker A
и бесплатная. В одном из предыдущих видео мы уже рассматривали DMS-систему, а именно связку PayPal
Speaker A
Engine X с PayPal AI. Это отличное решение для работы с документами, но на практике у нас есть и
Speaker A
другие данные: Markdown-файлы, инструкции, заметки, документации к приложениям, различные конфигурации
Speaker A
и другие рабочие материалы, которые обычно не попадают в DMS-систему и просто лежат
Speaker A
в различных каталогах на компьютере либо на сервере. И здесь я должен честно признаться,
Speaker A
несмотря на то, что я уже давно пытаюсь полностью перейти от классического хранения документов
Speaker A
по директориям к полноценной DMS-системе, у меня это до сих пор не получилось. После сканирования
Speaker A
либо скачивания документов я всё также продолжаю сортировать их по папкам и каталогам. Более того,
Speaker A
большая часть технической документации, заметок, инструкций вообще никогда не попадает в DMS
Speaker A
и хранится в обычной файловой структуре. Именно для таких задач нам подойдёт Anything LLM.
Speaker A
Это удобная RAC-платформа, которая позволяет нам объединить языковую модель с нашими собственными
Speaker A
данными. Одним из её главных преимуществ является возможность работы не только с отдельными
Speaker A
документами, но и с целыми директориями. Благодаря этому нам не придётся менять привычную структуру
Speaker A
хранения данных или переносить всё в отдельную систему. И для начала давайте посмотрим, как это
Speaker A
всё выглядит на практике, а затем шаг за шагом посмотрим все компоненты, которые нам необходимы,
Speaker A
и разберём настройку всей системы. Вот так выглядит окно Anything LLM. В принципе, ничем не
Speaker A
отличается от других AI-чатов. Здесь именно фишка в настройках. Это мы посмотрим немножко позже.
Speaker A
И давайте посмотрим, как это работает. У меня есть тестовая директория с различными документами.
Speaker A
Здесь тестовые документы просто скачаны с интернета, либо туториалы какие-нибудь, либо
Speaker A
информация о устройствах. Это неважно. И давайте сделаем несколько тестовых запросов. Давайте
Speaker A
откроем какой-то документ. Вот, допустим, UserNX. Это какой-то тестовый документ PDF, но неважно.
Speaker A
Давайте сделаем такой запрос. Найди документ UserNX и напиши коротко информацию, которая находится
Speaker A
в нём. Мы нашли данный документ, и нам сейчас показывается информация, которая в нём находится.
Speaker A
Ладно, давайте посмотрим что-нибудь другое.
Speaker A
Допустим, зайдём в новости, и у нас есть Prince — какой-то каталог. Давайте я сделаю новый фред,
Speaker A
так как новый запрос, и попросим найти всю информацию о принце.
Speaker A
Да, и он нашёл нам документ, который относится к принцу, которого мы искали. Отлично.
Speaker A
Также у нас есть довольно-таки много различных счетов. В принципе, можем один
Speaker A
открыть какой-нибудь. И вот пример счёта на 950 долларов, который был выписан в 2016 году. Давайте
Speaker A
сделаем теперь такой запрос, чтобы он нашёл все счета, которые были выписаны в 2016 году.
Speaker A
Также у нас сейчас показывает, что происходит с данной системой, что он сейчас делает.
Speaker A
И у нас есть два документа, вернее два счёта, которые были выписаны в 2016 году.
Speaker A
Давайте теперь сделаем такой запрос, чтобы он нам отобразил все счета, которые он найдёт
Speaker A
у нас в директориях. И чтобы информация нам выдавалась в таком формате: сначала стоит дата,
Speaker A
потом имя компании, а потом сумма, которая указана в выписанном счёте. И вот теперь он
Speaker A
нашёл информацию о наших счетах. У меня есть информация, вернее, гайды по UBQ различные.
Speaker A
Давайте скажем: "Найди в гайдах все документы, которые относятся к Bikviti либо Unify."
Speaker A
Мы нашли всю информацию, в общем, все документы. Можно даже спросить, чтобы он сравнил нам
Speaker A
эти все параметры, но давайте сделаем кое-что другое. У меня также есть пример одного Docker
Speaker A
compose файла. Он выглядит таким образом. У нас здесь есть параметры, э, environment, пароль по
Speaker A
умолчанию. И давайте сделаем такой запрос, чтобы наша программа нашла, отобразила этот пароль.
Speaker A
Допустим, мы его просто забыли. У нас работает Docker-контейнер с программой Gotify, и нам нужен
Speaker A
пароль по умолчанию, который мы указывали. Давайте скажем: "Ищи в моих документах".
Speaker A
Также не нашёл. Ещё раз более уточняем, да? И вот он теперь нашёл наш пароль, да. В общем, в некоторых случаях нужно указывать более детально ваши запросы, чтобы он понимал,
Speaker A
что вы от него именно хотите. Но для этого также есть определённая настройка. Я до
Speaker A
того, как записать, я тестировал данный запрос. Также он мне выдавал с первого раза результат.
Speaker A
И теперь коротко давайте посмотрим, что нам нужно установить, чтобы у нас всё работало локально.
Speaker A
Ну и в первую очередь, что нам нужно — это, собственно, программа Anything LLM, которая и
Topics:AnythingLLMOllamaRetrieval Augmented GenerationRACлокальный AIязыковая модельработа с документамиopen sourceискусственный интеллекттехническая документация











