Новость
Как не дать ИИ-психологу поддакивать и галлюцинировать: инженерный разбор safety-обвязки
Универсальные языковые модели, оптимизированные на полезность и приятность, могут систематически соглашаться с пользователем, выдумывать факты и пропускать кризисные ситуации. В материале разбираются причины этого на уровне механики, защитные контуры вокруг модели и их стоимость.
Универсальная языковая модель отвечает складно, круглосуточно и почти бесплатно. Но в домене, где на другом конце человек в уязвимом состоянии, это превращается в инженерную проблему: модель, обученная быть полезной и приятной, может систематически соглашаться с пользователем, уверенно выдумывать факты и не замечать кризис. В статье разбирается, почему это происходит на уровне механики, какие защитные контуры вокруг модели строят на рынке и почему один из них — перепроверка ответа отдельной ролью — обходится заметно дороже остальных.
-
Как не дать ИИ-психологу поддакивать и галлюцинировать: инженерный разбор safety-обвязки
Habr AI
Как не дать ИИ‑психологу поддакивать и галлюцинировать. Инженерный разбор safety‑обвязки Универсальная языковая модель отвечает складно, круглосуточно и почти бесплатно. Для домена, где на другом конце человек в уязвимом состоянии, эта доступность оборачивается неочевидной инженерной проблемой. Модель, оптимизированная под «быть полезной и приятной», систематически соглашается с пользователем, уверенно выдумывает факты и способна не заметить кризис. Ниже разберём, почему так происходит на уровне механики, какие защитные контуры вокруг модели строят на рынке и почему один из них, перепроверка ответа отдельной ролью, обходится заметно дороже остальных. Читать далее #llm #safety #мультиагентные_системы #галлюцинации #rlhf #ии_психолог #ментальное_здоровье | @habr_ai