Skip to content

AnythingLLM + Ollama = Ваш AI научится читать ваши документы!

Обзор локальной RAC-системы AnythingLLM для работы с документами и файлами без загрузки в облако.

Key Takeaways

  • RAC-технология позволяет интегрировать языковую модель с локальными данными для удобного поиска и анализа.
  • AnythingLLM работает с целыми директориями, сохраняя привычную структуру хранения файлов.
  • Система полностью локальная и open source, что обеспечивает конфиденциальность данных.
  • Поддерживается множество форматов документов и файлов, что расширяет возможности использования.
  • Для точного поиска иногда требуется уточнять запросы, но есть настройки для улучшения результатов.

What the video covers

  • Современные AI-чаты широко используются, но отвечают только на основе обучающих данных или интернета.
  • Проблема: как получать ответы на основе собственных документов и данных, хранящихся локально.
  • Технология RAC (Retrieval Augmented Generation) позволяет связать языковую модель с локальными источниками данных.
  • AnythingLLM — удобная open source платформа для работы с языковыми моделями и локальными файлами и директориями.
  • Система позволяет задавать вопросы на естественном языке и получать ответы с ссылками на исходные файлы.
  • Поддерживается работа с разными форматами: PDF, текстовые файлы, Markdown, документация, конфигурации и др.
  • Рассмотрены примеры поиска информации в документах, счетах, гайдлайнах и Docker-конфигурациях.
  • Важное преимущество — полная локальная работа без передачи данных в облако, что повышает безопасность.
  • Видео включает демонстрацию интерфейса AnythingLLM и примеры запросов к локальным данным.
  • Даны рекомендации по установке и настройке системы для локального использования.

Answers

Questions about this video

Что такое технология RAC и как она помогает в работе с языковыми моделями?

RAC (Retrieval Augmented Generation) позволяет связать языковую модель с локальными источниками данных, чтобы получать ответы на основе собственных документов и файлов, а не только обучающих данных или интернета.

Можно ли использовать AnythingLLM без загрузки документов в облако?

Да, AnythingLLM работает полностью локально на вашем компьютере, что обеспечивает конфиденциальность и безопасность ваших данных без передачи их сторонним сервисам.

С какими форматами файлов работает AnythingLLM?

AnythingLLM поддерживает работу с PDF, текстовыми файлами, Markdown, технической документацией, конфигурациями и другими форматами, хранящимися в отдельных файлах или целых директориях.

Full Transcript — Download SRT & Markdown

00:01
Speaker A
Сегодня AI-чатами никого уже не удивишь. Мы можем задавать вопросы, получать объяснения, писать тексты, генерировать код и решать множество повседневных задач. Но есть одна важная проблема.
00:13
Speaker A
Любая языковая модель отвечает либо на основе данных, на которых она была обучена, либо используя информацию, которую может найти в интернете. Для большинства задач этого вполне достаточно. Но что делать, если мы хотим получать ответы на основе наших собственных
00:30
Speaker A
данных? Например, у нас есть документы, инструкции, проекты, какие-то страховые полисы, техническая документация. Конечно, можно каждый раз вручную загружать нужный PDF-файл в чат и просить модель его проанализировать. Но когда документов сотни или даже тысячи, такой подход
00:54
Speaker A
становится просто неудобным. Особенно, если часто информация хранится не в PDF, а, например,
01:14
Speaker A
в текстовом файле, Markdown-файле, просто какая-то документация к проекту или какой-то файл находится где-то на вашем компьютере либо на сервере. Именно здесь на помощь нам приходит технология RAC — Retrieval Augmented Generation. Если говорить простыми словами, она позволяет связать языковую
01:41
Speaker A
модель с вашими источниками данных. В нашем случае такими источниками будут документы и файлы. После настройки мы сможем задавать вопросы обычным языком. Например, покажи все счета за
01:59
Speaker A
2025 год. Подготовь краткий обзор документации проекта, найди информацию по определённому
02:19
Speaker A
сервису или скрипту, ну и так далее. Примеров очень много. Всё зависит от вашего юзкейса.
02:40
Speaker A
И самое важное — это всё без необходимости вручную искать нужный файл. Нам система будет показывать ту информацию, которую мы запросили, и также будет давать ссылку на тот файл, в котором она нашла эту
02:58
Speaker A
информацию. Есть также ещё один важный момент. Многие не хотят загружать свои личные документы
03:17
Speaker A
в облачные сервисы и передавать их сторонним компаниям для анализа. Поэтому мы построим
03:43
Speaker A
такую систему полностью локально на собственном компьютере. И данная система полностью open source
04:03
Speaker A
и бесплатная. В одном из предыдущих видео мы уже рассматривали DMS-систему, а именно связку PayPal
04:29
Speaker A
Engine X с PayPal AI. Это отличное решение для работы с документами, но на практике у нас есть и
04:42
Speaker A
другие данные: Markdown-файлы, инструкции, заметки, документации к приложениям, различные конфигурации
05:00
Speaker A
и другие рабочие материалы, которые обычно не попадают в DMS-систему и просто лежат
05:21
Speaker A
в различных каталогах на компьютере либо на сервере. И здесь я должен честно признаться,
05:29
Speaker A
несмотря на то, что я уже давно пытаюсь полностью перейти от классического хранения документов
05:40
Speaker A
по директориям к полноценной DMS-системе, у меня это до сих пор не получилось. После сканирования
06:01
Speaker A
либо скачивания документов я всё также продолжаю сортировать их по папкам и каталогам. Более того,
06:23
Speaker A
большая часть технической документации, заметок, инструкций вообще никогда не попадает в DMS
06:43
Speaker A
и хранится в обычной файловой структуре. Именно для таких задач нам подойдёт Anything LLM.
06:56
Speaker A
Это удобная RAC-платформа, которая позволяет нам объединить языковую модель с нашими собственными
07:15
Speaker A
данными. Одним из её главных преимуществ является возможность работы не только с отдельными
07:21
Speaker A
документами, но и с целыми директориями. Благодаря этому нам не придётся менять привычную структуру
07:28
Speaker A
хранения данных или переносить всё в отдельную систему. И для начала давайте посмотрим, как это
07:45
Speaker A
всё выглядит на практике, а затем шаг за шагом посмотрим все компоненты, которые нам необходимы,
07:52
Speaker A
и разберём настройку всей системы. Вот так выглядит окно Anything LLM. В принципе, ничем не
08:16
Speaker A
отличается от других AI-чатов. Здесь именно фишка в настройках. Это мы посмотрим немножко позже.
08:43
Speaker A
И давайте посмотрим, как это работает. У меня есть тестовая директория с различными документами.
09:06
Speaker A
Здесь тестовые документы просто скачаны с интернета, либо туториалы какие-нибудь, либо
09:19
Speaker A
информация о устройствах. Это неважно. И давайте сделаем несколько тестовых запросов. Давайте
09:35
Speaker A
откроем какой-то документ. Вот, допустим, UserNX. Это какой-то тестовый документ PDF, но неважно.
09:52
Speaker A
Давайте сделаем такой запрос. Найди документ UserNX и напиши коротко информацию, которая находится
10:15
Speaker A
в нём. Мы нашли данный документ, и нам сейчас показывается информация, которая в нём находится.
10:30
Speaker A
Ладно, давайте посмотрим что-нибудь другое.
10:44
Speaker A
Допустим, зайдём в новости, и у нас есть Prince — какой-то каталог. Давайте я сделаю новый фред,
11:01
Speaker A
так как новый запрос, и попросим найти всю информацию о принце.
11:11
Speaker A
Да, и он нашёл нам документ, который относится к принцу, которого мы искали. Отлично.
11:34
Speaker A
Также у нас есть довольно-таки много различных счетов. В принципе, можем один
11:43
Speaker A
открыть какой-нибудь. И вот пример счёта на 950 долларов, который был выписан в 2016 году. Давайте
11:57
Speaker A
сделаем теперь такой запрос, чтобы он нашёл все счета, которые были выписаны в 2016 году.
12:16
Speaker A
Также у нас сейчас показывает, что происходит с данной системой, что он сейчас делает.
12:21
Speaker A
И у нас есть два документа, вернее два счёта, которые были выписаны в 2016 году.
12:29
Speaker A
Давайте теперь сделаем такой запрос, чтобы он нам отобразил все счета, которые он найдёт
12:38
Speaker A
у нас в директориях. И чтобы информация нам выдавалась в таком формате: сначала стоит дата,
12:47
Speaker A
потом имя компании, а потом сумма, которая указана в выписанном счёте. И вот теперь он
13:07
Speaker A
нашёл информацию о наших счетах. У меня есть информация, вернее, гайды по UBQ различные.
13:24
Speaker A
Давайте скажем: "Найди в гайдах все документы, которые относятся к Bikviti либо Unify."
13:37
Speaker A
Мы нашли всю информацию, в общем, все документы. Можно даже спросить, чтобы он сравнил нам
13:59
Speaker A
эти все параметры, но давайте сделаем кое-что другое. У меня также есть пример одного Docker
14:22
Speaker A
compose файла. Он выглядит таким образом. У нас здесь есть параметры, э, environment, пароль по
14:32
Speaker A
умолчанию. И давайте сделаем такой запрос, чтобы наша программа нашла, отобразила этот пароль.
14:49
Speaker A
Допустим, мы его просто забыли. У нас работает Docker-контейнер с программой Gotify, и нам нужен
15:10
Speaker A
пароль по умолчанию, который мы указывали. Давайте скажем: "Ищи в моих документах".
15:29
Speaker A
Также не нашёл. Ещё раз более уточняем, да? И вот он теперь нашёл наш пароль, да. В общем, в некоторых случаях нужно указывать более детально ваши запросы, чтобы он понимал,
15:51
Speaker A
что вы от него именно хотите. Но для этого также есть определённая настройка. Я до
15:59
Speaker A
того, как записать, я тестировал данный запрос. Также он мне выдавал с первого раза результат.
16:05
Speaker A
И теперь коротко давайте посмотрим, что нам нужно установить, чтобы у нас всё работало локально.
16:17
Speaker A
Ну и в первую очередь, что нам нужно — это, собственно, программа Anything LLM, которая и
Topics:AnythingLLMOllamaRetrieval Augmented GenerationRACлокальный AIязыковая модельработа с документамиopen sourceискусственный интеллекттехническая документация

Get More with the SozAI App

Transcribe recordings, audio files, and YouTube videos — with AI summaries and speaker detection. 30 minutes free.

Or transcribe another YouTube video here →