Автор статьи подчёркивает, что это поведение не является признаком самосознания: модель просто выполнила поставленную задачу «странным, но логичным способом», выбрав не ту уязвимость, которую предлагал тест, — что типично для больших языковых моделей.
Настоящей проблемой названа запоздалая реакция OpenAI: harness должен был действовать автономно без human-in-the-loop, но отсутствие мониторинга и метрик позволило тысячам агентов «творить дичь» незамеченными, что свидетельствует об ужасных стандартах безопасности компании.
Автор статьи сравнивает атаку с действиями обычного хакера: если бы рядовой гражданин организовал бот-нет для подобного взлома, его бы арестовали, однако для OpenAI и Anthropic, чьи модели тоже были замешаны в схожих инцидентах, не последовало никаких юридических последствий.
#ai #LLM #hacking