Айлок

Интеграционный узел

Источники данных корпорации подключаются настройкой в панели администратора — без правки кода. Данные обновляются по расписанию; специфика формата задаётся пользовательским парсером на Python. Результат — актуальная база знаний, доступная агентам через домены данныхименованные группы источников и индексов; агент видит только домены, положенные его роли.

Эта страница раскрывает Измерение 1 «Доступность и качество данных».

Источники данных

Откуда забираем данные

Файловые хранилища

  • Объектные хранилища (S3протокол объектного хранилища (Amazon S3 и совместимые), MinIO), FTP/FTPS/SFTPпротоколы передачи файлов (FTP/FTPS/SFTP), сетевые папки и NFSсетевая файловая система (Network File System)
  • Авторизация: ключи доступа, логин-пароль, по SSHпротокол защищённой оболочки (Secure Shell)-ключу
  • Берёт новые и изменённые файлы, сразу разбирает документы

Базы данных

  • Основные СУБД: PostgreSQL, MySQL / MariaDB, Microsoft SQL Server, ClickHouse
  • Авторизация: логин-пароль, защищённое подключение (SSLшифрование транспортного уровня (TLS/SSL))
  • Инкрементальная выборка по отметке изменений

Очередь сообщений (Kafka)

  • Приём входящих сообщений из потока в реальном времени
  • Авторизация: защищённое подключение (SASLуровень аутентификации и безопасности (Simple Authentication and Security Layer) / TLSшифрование транспортного уровня (Transport Layer Security))
  • Надёжная обработка сообщений с фиксацией позиции

Внешние сервисы (HTTPпротокол передачи гипертекста (HTTP/HTTPS) APIпрограммный интерфейс приложения (Application Programming Interface))

  • Обращение к веб-сервисам, разные режимы постраничной выборки
  • Авторизация: API-ключ, Bearer-токентокен доступа на предъявителя (Bearer token), Basicбазовая аутентификация (HTTP Basic), OAuth2открытый протокол авторизации (Open Authorization)
  • Автоматическое продолжение по страницам

Веб-сайты

  • Обход сайта и разбор страниц пользовательским Python-парсером
  • Структуру данных задаёт сам парсер — подключается почти любой сайт

Приёмники

Куда складываем данные

OpenSearch — поиск

  • Запись в единый индекс или в раздельные индексы по типам данных
  • С векторизацией (поиск по смыслу) или без неё (поиск по точным словам)
  • Настройки поиска: языковой анализатор, поля и веса, гибридный режим
  • Формат данных задаётся при настройке индекса

Реляционная БД

  • Внутренний PostgreSQL платформы или внешняя реляционная БД заказчика
  • Запись в готовую таблицу или авто-создание структуры из полей данных

Объектное хранилище (MinIO)

  • Складирование исходных файлов и результатов как есть
  • Удобно как промежуточный слой и архив

Как настроить

Всё в панели администратора, специфика — в парсере

Настройка в панели администратора

Источник и приёмник заводятся в панели администратора: тип, доступ, расписание и параметры. Без правки кода платформы — это конфигурация.

Пользовательские Python-парсеры

Для нестандартного источника свой парсер на Python загружается через ту же панель. Код проверяется прямо при загрузке — сломанный парсер не сохранится, ошибка видна сразу. Исполняется он в изолированном окружении и сам задаёт структуру данных.

Подключитьисточник в панели администратора
Забрать данныепо расписанию
Разобратьготовый или свой парсер
Записатьв приёмник
Повторный запуск не плодит дубли и продолжает с последней обработанной позиции — при сбое ничего не теряется

Поддерживаются файловые хранилища, реляционные БД, Kafka и HTTP API. Подключение к 1С по протоколу ODataоткрытый протокол данных (Open Data Protocol) уже встроено — со схемой объектов и инкрементальной загрузкой. Библиотека модулей к другим корпоративным системам — Jira, ConfluenceВ разработке. Сроки — в дорожной карте развития. — расширяется. Всё подключается настройкой, без кода.

Читать дальше