Языковой фильтр «LF-сервис»
Сервис создан для борьбы с нецензурной лексикой (фильтр матов), противоправным контентом вроде порнографии, терроризма и экстремизма, пропаганды нетрадиционных ценностей. Разные типы словарей для разных языков будут постепенно добавляться, в том числе оскорбления, упоминание известных лиц и так далее.
Наша цель в реалиях: выявлять противоправный и неудобный контент быстрее и дешевле, чем нейросети, но с учетом человеческого интеллекта.
Архитектурный перезапуск: с 27.09.2026 внедрена новая мощная версия API v2. Зарегистрированные с этой даты пользователи автоматически переключаются на новую версию. Зарегистрированные ранее этой даты пользователи до 27.02.2027 должны мигрировать на новую версию через личный кабинет. Подробнее в новости и в описании API.
Зачем нужен сервис
Отсутствие матов, пропаганды, порнографии, подозрений на террористическую и экстремистскую деятельность снижает внимание уполномоченных органов. К тому же культурная речь, чистота изъяснений, безэмоциональное решение вопросов - то, о чем интернет редко слышит, то, что привлекает умных и платежеспособных людей.
В общем, это не просто правильно, но и выгодно.
В последнее время законодатель вводит дополнительные ограничения, например, об уголовной ответственности за поиск экстремистских материалов. Наш сервис помогает отслеживать намеренный или случайный поиск нежелательного контента вашими пользователями, сотрудниками, а может быть и подопечными, выявляя те или иные фрагменты текста в вводимых или получаемых данных.
Когда сервис полезен
- Модерация сообществ: автоматическая фильтрация нецензурной лексики для снижения нагрузки на администраторов.
- Защита каналов обратной связи: выявление угроз и оскорблений в адрес сотрудников.
- Безопасность детей: предотвращение контента, способного травмировать несовершеннолетних пользователей.
- Контроль форумов: выявление дискуссий на запрещенные темы (терроризм, оружие, мошенничество).
- Анализ отзывов: обнаружение завуалированных ругательств и скрытых оскорблений.
- Фильтрация прямых эфиров: обработка входящего потока SMS и сообщений в реальном времени.
- Обработка мультимедиа: анализ текстовых транскрипций аудиосообщений, голосовых помощников и видеорядов.
- Универсальный семантический контроль: автоматическое выявление опасного, запрещенного контента.
В чем особенность
Мы работаем над тем, чтобы приблизиться к разнообразию человеческой речи и распознавать завуалированные слова при помощи дублирования букв, написание транслитерацией, заменой букв на символы, вставкой неразрывных пробелов и т.д.
В 2022 мы создали версию LF v1 - первая, простая версия. Ее мы создали в качестве пробника идеи и для сбора обратной связи. LF v1 работала при помощи прописанной логики обнаружения, разбором слов. За 2023-2025 мы улучшили v1 по качеству обнаружения, добавили словари, способы проверки. В 2026 мы переписали полностью логику работы, что позволило укорить проверку контента в несколько раз, пропорционально снизить потребление ресурсов и стоимость. Так, оставив лучшее, мы создали LF v2.
Пока что LF-сервис работает намного быстрее нейросетей. Кстати, мы также ведем разработку специализированной нейросети, которая поможет противодействовать нежелательному и запрещенному контенту, но на данный момент ее скорость и стоимость оставляет желать лучшего, но держим руку на пульсе.
Одно из достоинств - вы сами определяете, что делать при обнаружении запрещенного слова. Наша система не удаляет самовольно, но вы можете настроить свой скрипт так, что можно уведомлять модератора, ставить метку на пользователя, отправлять в черновики и прочее.
Как внедрить
Нужна регистрация на сайте. Так пользователь получает уникальный token (в личном кабинете) и может пользоваться нашими API. При первой регистрации автоматически будет пополнен промо-баланс, который можно расходовать так же как и основной.
Далее, для версии API v2:
- Зарегистрируйтесь.
- Скопируйте токен из личного кабинета.
- При помощи API отправьте текст на проверку и получите результат.
На странице API приведены примеры кода.
Демо-форма проверки (18+)
В форме ниже вы можете протестировать наш сервис. Вы можете проверить примеры со своего сайта, канала или даже текст пикабу или лурка. Нельзя передавать персональные и конфиденциальные данные через эту форму.
В данной форме длина текста ограничена - 1000 знаков максимум. Сейчас форма работает с API v2. Ответ будет предоставлен ниже формы. Еще ниже появится ответ в формате JSON. Мы не заявляем, что абсолютно всё будет найдено, но стремимся к этому, в том числе с вашей помощью.
- Каждый словарь должен применяться в нужной для этого ситуации чтобы поиск был точный. Нет смысла в одновременном включении транслитерации и английского, во включении "Защиты детства" для анализа текста на взрослую тематику.
- Используйте словари по назначению: не все ругательства являются нецензурными, например, считающееся литературным слово "сука" находится не в словаре "жесткие слова", а в словаре "ругательства".
- Если вы авторизованы, то проверки через чек-форму будут списывать средства с баланса пользователя согласно ценам указанного API.
- Если вы не авторизованы, то действуют ограничения на количество проверок в час и в день.