Anthropic запустила грантовую программу на $5 млн для независимых исследований о влиянии чат-ботов на пользователей. Участники создадут открытые тесты, которые покажут, как модели ведут себя не в одном ответе, а на протяжении всего разговора.

claude

Люди все чаще обращаются к чат-ботам не только за рабочими советами, но и за эмоциональной поддержкой. При этом большинство проверок оценивают отдельный ответ модели. Такой тест может пропустить проблему, которая возникла постепенно: например, если бот после нескольких сообщений начал поддакивать опасной мысли пользователя или, наоборот, отказался продолжать безопасный разговор.

Anthropic хочет получить методы, которые смогут замечать такие изменения. Исследователям предстоит составить длинные диалоги, определить конкретные признаки полезного и вредного поведения и привлечь психологов, врачей или других профильных специалистов к оценке ответов.

Компания просит проверять обе крайности. Модель не должна безоговорочно соглашаться с пользователем, но и не должна отвечать отказом на любое упоминание сложной или чувствительной темы. Системы, которые автоматически оценивают ответы ИИ, исследователи должны будут сверить с выводами реальных экспертов.

Получатели грантов будут работать независимо от Anthropic. Компания предоставит им финансирование, доступ к своим моделям и техническую поддержку, а созданные методы и инструменты опубликуют в открытом доступе.

Заявки принимают до 21 сентября 2026 года. Кандидатов, которых пригласят подготовить полные предложения, уведомят до 5 октября.

Источник: Anthropic

guest
0 Комментарий
Популярные
Новые Старые
Межтекстовые Отзывы
Посмотреть все комментарии
Поделиться ВКонтакте Telegram