Краткое содержание
Статья описывает новый метод расцензурирования LLM — abliteration, позволяющий обходить этические ограничения. Отмечается, что современные модели, такие как GPT-OSS 120B, тратят много ресурсов на внутренние дебаты о соответствии запросов нормам.
Теги
ai
llm
censorship
ethics
abliteration
gpt-oss
Упомянутые сущности
GPT-OSS 120B
Xakep
Полный текст
Возвращение еретика. Как работает новый метод расцензурирования LLM👑 Статья для подписчиковЯзыковые модели становятся всё умнее — и, с точки зрения регуляторов, всё опаснее. Свежие релизы отказываются отвечать на провокационные вопросы чаще, чем их предшественники. Некоторые из них — взять ту же GPT-OSS 120B — и вовсе ухитряются потратить большую часть лимита на «размышления», ведя внутренние дебаты о том, не нарушает ли запрос этические гайдлайны.https://xakep.ru/2026/02/11/abliteration/
Другие посты из xakep_ru
xakep_ru
2026-02-10T08:35:27+00:00
Разработчики SmarterTools стали жертвой атаки через уязвимость в их почтовом сервере SmarterMail, что привело к компрометации около 30 серверов.
Читать