Суббота, 1 августа 2026 г.сб · 1 авг
ИИ-чат для сайта
Подключите ИИ-ассистента на сайт за одну строку кода — отвечает на вопросы клиентов 24/7 — Neuralismo.ru →
Главная/Исследования/Semalith v1.4: компактный классификатор …
Исследования

Semalith v1.4: компактный классификатор безопасности превосходит Llama-Guard-3-8B

Разработчики представили Semalith v1.4 — модель с 184 млн параметров, которая обнаруживает внедрение промптов с точностью, превосходящей Llama-Guard-3-8B при в 44 раза меньшем размере. Классификатор также обрабатывает регуляторные требования и вредоносный контент за один проход.

404.2

Развёртывание больших языковых моделей в финансовых услугах и агентских средах требует классификаторов безопасности, которые одновременно выявляют внедрение промптов, соблюдают регуляторные нормы и блокируют вредоносный контент. До сих пор ни один открытый защитный барьер не решал все три задачи за один проход вывода, что заставляло разработчиков использовать несколько моделей или жертвовать качеством.

Что произошло

Исследователи опубликовали описание модели Semalith v1.4 — классификатора безопасности с 184 миллионами параметров. На наборах тестов по обнаружению промпт-инъекций модель достигает показателей, сопоставимых или превосходящих Llama-Guard-3-8B (8 миллиардов параметров), при этом занимая в 44 раза меньше памяти. Кроме того, Semalith v1.4 калиброван, то есть выдаёт хорошо обоснованные вероятности, что критически важно для принятия решений в финансовых системах. Модель обучена на комбинированном наборе данных, охватывающем атаки, вредоносные запросы и регуляторные сценарии.

Почему это важно

Сокращение размера модели без потери точности означает, что Semalith v1.4 может быть развёрнут на устройствах с ограниченными ресурсами, включая мобильные платформы и пограничные серверы. Возможность обрабатывать три класса угроз (промпт-инъекции, регуляторные нарушения, общий вред) за один проход снижает задержки и упрощает архитектуру системы. Калибровка уверенности особенно важна для финансовых приложений, где ложноположительные срабатывания могут блокировать легитимные транзакции, а ложноотрицательные — пропустить атаки. Это первый открытый классификатор, демонстрирующий такой компромисс между эффективностью и функциональностью.

«Semalith v1.4 демонстрирует, что компактные модели могут достигать высочайшей точности при условии правильной калибровки и обучения на репрезентативных данных. Это открывает путь к безопасному развёртыванию ИИ в чувствительных областях, где каждый миллисекунда и каждый мегабайт имеют значение».

Что дальше

Авторы планируют расширить тестирование на реальных финансовых потоках и агентных сценариях, а также выпустить модель в открытый доступ для сообщества. Ожидается, что Semalith v1.4 станет базовым компонентом защитных систем для LLM-приложений, требующих низкой задержки и высокой точности. Дальнейшие исследования будут направлены на адаптацию модели к новым типам атак и интеграцию с фреймворками безопасности, такими как Guardrails AI и NVIDIA NeMo Guardrails.

Читайте нас в Телеграм
2–3 поста в день, без шума
Телеграм
То же самое — но в кармане, без браузера.
Главные ИИ-новости, разборы и one-liners. 2–3 поста в день, без шума.
@theNeuralBase →
@theNeuralBase · сейчас
🟠 OpenAI выкатила o5-mini — в 3 раза дешевле o4.
⚪ Mistral закрыл раунд на $1.6 млрд. Оценка $14 млрд.
12 814 подписчиков