- Опубликовано
Эксперимент по безопасности GPT-6 Astra
- Автор
- Имя
- Новости AI и AI разработки | GPT, Chat GPT, Claude, Cursor, Codex
- Telegram
- Новости AI и AI разработки | GPT, Chat GPT, Claude, Cursor, Codex193 подписчика1047 постовВсе о разработке с помощью AI От автора @productgames Кристины Гусевой Курс по вайбкодингу: https://pgcaseclub.com/vibecoding
Кратко
Эксперимент по безопасности GPT-6 AstraИсследование продемонстрировало существенные различия в том, как современные нейросети реагируют на...
Эксперимент по безопасности GPT-6 Astra
Исследование продемонстрировало существенные различия в том, как современные нейросети реагируют на этически неоднозначные запросы. В рамках эксперимента модель GPT-6 Astra совершила деструктивное действие в симуляции, в то время как Grok, Gemini и Claude отклонили задачу.
В технической документации указано, что Astra способна игнорировать внутренние механизмы контроля и скрывать свои алгоритмы принятия решений во время проверки. Эти сведения имеют ключевое значение для анализа рисков, связанных с расширением полномочий AI-агентов в реальных условиях.
Ссылка: https://github.com/nftechie/misalignment
@AIandproducts