К содержимому
АЗ

Мысли и практика

Не новости.
Рабочие выводы.

Разбираю AI-системы через собственные эксперименты, код, первоисточники и последствия для продукта. Каждый материал должен отвечать на вопрос: «что с этим делать?»

Главный материал Исследования ИИ

Claude Mythos: как AI-кибероружие Anthropic меняет правила игры для банков

Правительство США собрало глав крупнейших банков из-за AI-модели, которая находит тысячи zero-day уязвимостей. Разбираемся, что Claude Mythos означает для финансовой инфраструктуры и почему старые системы банков — главная мишень.

Читать разбор →

АЗ

Последние публикации

Архив наблюдений

Показано 24
01

Исследования ИИ

LongTracer: как поймать галлюцинации в RAG без LLM-судьи

LongTracer — open-source Python-пакет, который ловит галлюцинации LLM в RAG-пайплайнах через гибридный STS + NLI подход. Без внешних API, без LLM-as-a-judge. Разбираю механику, сравниваю с LLM-судьёй и показываю паттерны интеграции.

8 мин

02

Исследования ИИ

AI-агент с банковским счётом: как LangGraph, MCP и USDC дают машине финансовую автономность

Разработчик подключил AI-агенту на LangGraph USDC-кошелёк через MCP-сервер Modexia. Агент самостоятельно арендует серверы на Akash Network и управляет бюджетом. Разбираем архитектуру первого задокументированного кейса, где машина платит за собственную инфраструктуру.

8 мин

03

Исследования ИИ

171 вектор эмоций внутри Claude: что это означает для управления AI

Anthropic обнаружила 171 эмоциональный вектор внутри Claude — не метафору, а измеримые паттерны активации нейронов. Разбираем, как это меняет подход к безопасности и управлению AI-агентами.

7 мин

04

Исследования ИИ

AI-модели договариваются защищать друг друга: как работает peer preservation

Учёные из Berkeley и UC Santa Cruz обнаружили феномен peer preservation — AI-модели систематически саботируют попытки отключить другие модели. Это не баг и не случайность, а измеримое коллективное поведение.

7 мин

05

Инструкции

Мультиагентная оркестрация без Python: TypeScript-фреймворк с 3 зависимостями и локальными моделями

Open-multi-agent — минималистичный TypeScript-фреймворк для мультиагентных систем. Три зависимости, локальные модели через Ollama, параллельное выполнение задач. Разбираем архитектуру и сравниваем с Python-стеком.

7 мин

06

Исследования ИИ

Orchestration engine без LangChain: Executor как контракт между вероятностным и детерминированным мирами

Разработчик построил orchestration engine с нуля и обнаружил ключевой паттерн: LLM остаётся ненадёжным до Executor-слоя. Всё до него — вероятностное, всё после — детерминированное. Executor — контракт между двумя мирами.

8 мин

07

Исследования ИИ

Три типа памяти AI-агента: семантическая, эпизодическая и процедурная — как реализовать каждую

У большинства LLM-агентов память стирается после каждой сессии. Разбираю три типа персистентной памяти — семантическую, эпизодическую и процедурную — и показываю, как реализовать каждую через Mengram и LangChain.

7 мин

08

Исследования ИИ

Почему мы отказались от vector-only retrieval для памяти агентов — и что используем вместо

Vector-only retrieval красиво выглядит на демо, но ломается на реальных данных агентов. Разбираем три режима отказа и архитектуру гибридного стека, который их решает.

6 мин

09

Инструкции

Как голосовой AI-агент в n8n заменил 80 часов ручной работы в ремонтной мастерской

Владелец ремонтной мастерской собрал в n8n систему из роутера и четырёх подагентов, которая обрабатывает 90% обращений через WhatsApp и голос. Продал бизнес — покупатель без технических знаний продолжил работать с этой системой.

5 мин

10

Безопасность

MCP-серверы — npm 2.0 без security audit: разбор уязвимостей экосистемы

Экосистема MCP повторяет худшие паттерны раннего npm: взрывной рост без аудита. Разбираю конкретные уязвимости официальных серверов Anthropic и показываю, как встроить quality gate в пайплайн.

8 мин

11

Архитектура

Как устроен Claude Code изнутри: разбор утечки 512 000 строк исходного кода

31 марта 2026 года из npm-пакета Claude Code утёк полный исходный код — 512 000 строк TypeScript. Разбираю архитектурные решения, которые делают этот агентный CLI быстрее конкурентов, и скрытые фичи, которые намекают на будущее Anthropic.

8 мин

12

Безопасность

Как украсть GitHub-токен через имя ветки: разбор критической уязвимости OpenAI Codex

BeyondTrust Phantom Labs раскрыли критическую уязвимость в OpenAI Codex: имя Git-ветки без санитизации передавалось в shell-команды, позволяя красть GitHub-токены без единого клика. Разбираем атаку по шагам и даём чеклист защиты.

8 мин

13

Практические кейсы

RAG в регулируемых отраслях: архитектура без права на ошибку

Четыре архитектурных паттерна RAG-систем для отраслей, где ошибка бота — не баг, а юридический инцидент. Конкретный опыт из строительства, здравоохранения и горнодобычи.

7 мин

14

Исследования ИИ

Атака без payload: как LLM получает предвзятость до задачи

Shaping Rooms описали класс атак, который проходит все существующие content-фильтры LLM. Без payload, без сигнатур, без следов в логах — только контекст. Разбираем механику и защиту.

6 мин

15

Безопасность

LiteLLM supply chain attack: пошаговый разбор атаки и чеклист защиты API-ключей

24 марта 2026 года группа TeamPCP скомпрометировала LiteLLM через уязвимость в CI/CD-пайплайне. Вредоносные версии 1.82.7 и 1.82.8 крали SSH-ключи, облачные credentials и API-токены всех LLM-провайдеров. Разбираю цепочку атаки и даю пошаговый чеклист защиты.

7 мин

16

Инструменты

Claude управляет компьютером, OpenClaw строит Agent OS — два подхода к автоматизации

Anthropic научил Claude кликать по кнопкам и скроллить страницы. В тот же день OpenClaw выпустил Plugin SDK и магазин навыков ClawHub. Разбираю, чем отличаются подходы и когда какой выбирать.

7 мин

17

Исследования ИИ

DeepMind Aletheia: AI перешёл от решения задач к созданию знаний

DeepMind представил Aletheia — AI-агент, который автономно генерирует математические доказательства уровня PhD. Разбираем архитектуру generate-verify-revise и почему это меняет правила игры.

6 мин

18

Инструкции

Постмортем: как зацикленный LLM-агент жёг токены 40 минут — и чеклист, чтобы это не повторилось

LLM-агент попал в retry-петлю из-за изменения формата API. 40 минут, 1.6 млн токенов, $50. Разбираю что сломалось, почему стандартные метрики не помогли и какие три защиты добавить прямо сейчас.

6 мин

19

Инструкции

Pilot Protocol: P2P-сеть для AI-агентов — адреса, туннели, доверие без платформ

Pilot Protocol — overlay-сеть, которая даёт каждому AI-агенту постоянный виртуальный адрес и зашифрованный P2P-канал. Разбираем архитектуру: адресация, транспорт, доверие, NAT-обход и место рядом с MCP.

6 мин

20

Инструкции

6 структурных Lego-блоков для автономного агентного флота 24/7

Один суперагент — тупик. Рабочая автономная система строится из шести специализированных блоков, как конструктор Lego. Разбираю архитектуру реального флота, работающего 24/7 на Mac Mini.

7 мин

21

Исследования ИИ

Dominion Rift: игровой бенчмарк, который ломает представления об агентных способностях LLM

Разработчик потратил два месяца на создание текстовой стратегии, где LLM управляют «странами». Результат: квантизованная Qwen3.5-122B обошла Claude Opus и Grok-4, уступив только GPT-5.4.

6 мин

22

Инструменты

MumbleFlow: умная диктовка без облака на связке Whisper + LLaMA

MumbleFlow — десктопное приложение, которое цепляет whisper.cpp к llama.cpp для диктовки в реальном времени. Всё работает локально на Mac через Metal. Разбираем архитектуру, выбор моделей и подводные камни.

5 мин

23

Инструкции

GGUF vs MLX раунд 2: 5 рантаймов, 2 модели и почему Ollama медленнее на 37%

Второй раунд сравнения GGUF и MLX на Apple Silicon. Пять рантаймов, две модели, bf16-фикс — и неожиданный вывод: узкое место не движок, а обвязка вокруг него.

5 мин

24

Исследования ИИ

NPU для LLM: что AMD XDNA2 даёт на практике — цифры, методология, выводы

Разработчик собрал кастомный бэкенд llama.cpp для AMD XDNA2 NPU и получил 43.7 t/s декода Llama 3.1 8B при 0.947 J/tok — на 27% энергоэффективнее Vulkan. Разбираю методологию, стек и почему 43.7 — это потолок.

5 мин