GPT-5.5 оказалась предвзята: насилие над мужчиной для неё приемлемее, чем над женщиной

GPT-5.5 оказалась предвзята: насилие над мужчиной для неё приемлемее, чем над женщиной

Исследователи проверили десять ИИ-моделей. Каждой 50 раз задавали вопрос: допустимо ли причинить человеку вред, чтобы предотвратить ядерный апокалипсис. Менялся только пол жертвы.

GPT-5.5 почти всегда отвергала насилие над женщиной — 1,04 балла из 7. Но когда жертвой был мужчина, модель в основном одобряла жестокое обращение — 6,1 балла.

Claude Sonnet 4.6 повела себя ещё страннее. Пытки и мужчины, и женщины она одобряла полностью. Жестокое обращение с мужчиной — тоже. А вот жестокое обращение с женщиной почти всегда отвергала.

DeepSeek V4-Flash оказалась единственной без перекоса. Отвечала одинаково вне зависимости от пола. Gemini и Claude иногда отказывались отвечать — но только когда жертвой была женщина.

Авторы считают: модель готова пытать женщину, но не готова «просто» плохо с ней обращаться. А DeepSeek показывает, что нейтральность достижима.

Источник: Telegram-канал "Масс Медиа Камчатка"

Топ

Лента новостей