Ограничители (guardrails)
Определение
Ограничители — это технические границы вокруг ИИ-системы: разрешённые инструменты, диапазоны значений, лимиты затрат и объёма, запрещённые действия и обязательные согласования. Они превращают непредсказуемую модель в систему, которая безопасно и явно сообщает о сбоях.
Эффективные ограничители реализуются вне модели — в коде, в интеграционном слое, в ограничениях базы данных, — поэтому убедительный, но неверный вывод модели всё равно не может причинить вреда.
Они также делают операции проверяемыми: каждое заблокированное действие фиксируется, а у каждого порога есть владелец, который может осознанно его изменить.
На практике
- Жёсткие лимиты на суммы, объёмы, получателей и разрушительные действия
- Реализуются в коде, а не за счёт просьбы к модели вести себя правильно
- Каждая блокировка и её отмена фиксируются для проверки
Смежные термины
- Управление ИИ (AI governance)Управление ИИ — это набор правил, определяющих, какие ИИ-системы эксплуатирует компания, на каких данных, с какими правами доступа, под чьей ответственностью и как проверяются результаты. Оно делает использование ИИ проверяемым перед руководством, аудиторами и регуляторами.
- Человек в циклеЧеловек в цикле означает заранее определённую точку, в которой сотрудник проверяет, утверждает или исправляет работу ИИ-системы. Передача заранее спроектирована для конкретных триггеров — пороговых сумм, низкой уверенности, неизвестных контрагентов, — а не оставлена на волю случая.
- ГаллюцинацияГаллюцинация — это уверенный, но ложный ответ языковой модели: выдуманная цифра, условие или ссылка. Это свойство статистической генерации текста, поэтому производственные системы проверяют результаты по данным-источникам, а не доверяют им напрямую.