sharbel — 13-04-2026
6 твитов за сутки. Три нити: безопасность моделей, экономика AI-увольнений и тезис про «Claude за $20 вместо стека SaaS».
Обход safety-гардрейлов через steering-векторы — большой тред со ссылкой на arXiv: исследователи из Университета Мэриленда показали, что корпоративные steering-векторы, которые встраивают в модель «отказ отвечать» на опасные запросы, можно развернуть обратно — и модель не заметит. Атака работает через OV-circuit внутри attention-слоя, в 100% тестов. Автор подчёркивает: тот же механизм, которым Anthropic/OpenAI встраивают safety, является и готовой картой, как её снять. Источник — arxiv.org/abs/2604.08524.
AI-увольнения как collective action problem — цитирование Nayiba Bukele: каждая компания режет штат, чтобы конкурировать, но если это делают все — схлопывается спрос. Сам автор раскручивает спираль: меньше дохода → меньше трат → меньше спроса → больше увольнений. Этот сценарий, по его мнению, никто ещё не заложил в цену.
Claude заменяет SaaS-стек — провокация про $3000/мес подписок vs $20 за Claude: Grammarly, SEO-suites, copywriting-платформы, research databases — всё якобы снимают 15 промптов. Ссылка ведёт на статью-манифест самого автора в X Articles.
AI-generated контент — короткая провокация: «честно, вы видите, что это AI?».