Skip to content
Neuronavt
Go back

AI-радар — 9 октября

Edit page
Отобрано 7 из 85 · 1 инструмент · 5 практик · 1 исследование

Главное за день

Сегодняшние кейсы показывают, что агентные системы выигрывают от осознанного ограничения контекста и числа инструментов, но такие решения нужно проверять на реальных задачах. Удобный ответ также не заменяет проверку источника и измерение результата.

Инструменты

Caveman сокращает ответы кодирующего агента

7/10

Перед установкой проверьте, окупает ли краткость ответов токены, потраченные на инструкции.

Автор предлагает открытый проект Caveman для сокращения пояснений кодирующего агента без переписывания кода, команд и ошибок. В демонстрационном примере ответ сокращён с 69 до 19 токенов; фактическая экономия зависит от задачи и накладных расходов на инструкции.

Практика

Как ограничивать инструменты ИИ-оркестратора

8/10

Для небольшой модели стоит проверять узкий набор инструментов и предусматривать случай, когда роутер не нашёл нужный.

Автор оркестратора с более чем 90 инструментами сравнивает показ полного списка с предварительным отбором. По его наблюдению, локальная модель 27B точнее работает с узким набором; при этом отбор требует обработки промахов роутера.

MCP-сервер: код проще продуктовых решений

8/10

При запуске MCP-сервера заранее продумайте доступ, совместимость имён инструментов и наблюдение за вызовами.

Автор добавила MCP-эндпоинт к существующему продукту с помощью агента за вечер. Сложнее оказалось определить состав инструментов и права доступа: соглашения об именовании различаются между каталогами и клиентами.

Открытый генератор LEGO-моделей с ИИ-агентами

8/10

Для генерации моделей можно использовать агентный конвейер с поиском деталей и проверкой полученного результата.

Автор представил открытое веб-приложение ldraw-nova, которое строит LEGO-модель по идее пользователя. На выходе доступны исходник LDraw, разные виды модели и редактируемый файл glTF; при отсутствии ключа для семантического поиска система переключается на полнотекстовый.

Справочник ремонта BMW без сложного поиска

8/10

Для небольшой базы документов попробуйте передавать её модели целиком, сохраняя возможность проверки ответа.

Автор создал мобильный справочник для BMW E90 325i с 20 процедурами ремонта, семью справочными разделами и ответами на вопросы. Ответы строятся по собранным процедурам; подход позволяет обойтись без отдельной RAG-инфраструктуры, но ремонтные данные требуют проверки.

Ответы по PDF с переходом к странице

8/10

Добавляйте переход к странице источника, но проверяйте сам фрагмент: ссылка ещё не доказывает ответ.

Автор собрал PDF Desk на Python, Streamlit, PageIndex и PDFium, чтобы отвечать на вопросы по одному PDF и открывать указанную страницу. Индекс и PDF остаются локально, но при выборе внешней модели текст отправляется провайдеру. Извлечение текста из PDF может искажать порядок колонок и структуру таблиц.

Исследования

Девять скиллов для кодинга проверили против плацебо

8/10

Оценивайте скиллы на своих задачах против текстового плацебо, а не только против запуска без инструкций.

Автор сравнил девять популярных программных скиллов с текстовыми плацебо на 450 запусках Claude Code. Большинство не показало убедительного преимущества; два немного снизили стоимость, а один ухудшил успешность. Контроль с плацебо помогает отделить эффект самих инструкций от эффекта добавленного текста.

Все кандидаты выпуска (173)
  1. У нашего ИИ-оркестратора более девяноста инструментов: работа с таблицами, документами, почтой, задачами, веб-страницам… 8/10
  2. Я сделала для своего продукта MCP-сервер. Написание и проверка кода заняла один вечер — писал конечно агент. 8/10
  3. Show HN: Made an open-source Lego AI generator 8/10
  4. The BMW manual was off-limits, so I built my friend something better 8/10
  5. «Срок гарантии — 18 месяцев». Красивый ответ. А если в договоре написано 12? Или число 18 стоит в разделе о хранении, а… 8/10
  6. Привет! Я Анастасия Никулина, руковожу отделом контента в IT-компании. Кроме продуктовой редакции, на мне SEO-блоги трё… 8/10
  7. В четверг был звонок на 57 минут, восемь человек. Голоса собеседников Nemotron разметил за 7 секунд. Мой микрофон тогда… 8/10
  8. I built my friend a Gemma-powered mock interviewer that talks back, entirely in the browser 8/10
  9. My friend runs her supplements shop from WhatsApp voice notes, so I built her a shop helper 8/10
  10. Сейчас у нас, как и почти везде, идёт переход на ИИ: каждому сотруднику пытаются выдать своего ИИ-агента. Очень быстро … 8/10
  11. Вечером я дописал на ноутбуке кусок проекта, утром сел за пк и начал объяснять ассистенту, что вчера было сделано. Втор… 8/10
  12. I Built an AI That Reads Eviction Notices and Refuses to Lie to You 8/10
  13. GitHub переписал движок своего ИИ-помощника Copilot. Получилось 832 378 строк нового кода, не считая тестов. Большинств… 8/10
  14. Publishing Markdown to Substack from an Agent Skill 8/10
  15. За последние 2 месяца я протестировал RTX PRO 6000 96GB / RTX4090 48GB и даже H200, оценивая варианты для селф-хоста, к… 8/10
  16. Бывает так, что ревьюер посмотрел пул-реквест, тесты зелёные, компиляция прошла успешно, а в коде всё равно остался баг… 8/10
  17. В прошлой статье я рассказывал, как устроено ядро нашего поиска: триграммы, crc32, словарь болей и два сита. В конце бы… 8/10
  18. Я в основном пользуюсь Claude Code и Codex. Во время работы с одним агентом постепенно накапливаются полезные знания: м… 8/10
  19. Всем привет! Меня зовут Костя, я QA-инженер в Банки.ру. Общение с агентом у меня давно стало обыденным делом. И в какой… 8/10
  20. Write Like It's 1866: LLMs Relearn Telegraphese 8/10
  21. Same prompt, four models: what Opus, Sonnet, Astra and Sol each got wrong 8/10
  22. Если в пути импорта в CLAUDE.md есть пробел, Claude Code обрывает путь на нём, файл не грузится, а ошибки нет. Так у ме… 8/10
  23. Большая часть материалов про Claude Code написана под macOS и Linux. У меня часть задач завязана на Windows, в первую о… 8/10
  24. Я несколько раз попадал в длинные очереди за бензином, конкретно за АИ‑95. В конце августа четыре часа простоял в очере… 8/10
  25. The model that didn't exist, so you made it yourself 8/10
  26. Tendril: a garden assistant you barely have to open 8/10
  27. Скиллы для Claude Code и Codex сейчас ставят пачками. У самых популярных сотни тысяч звёзд на GitHub, а в README встреч… 8/10
  28. Утро началось с того, что ко мне в личку пришел друг и спросил: «Кто это такой, этот Jev? Ты работаешь с ИИ, должен зна… 7/10
  29. В зелёном тестовом наборе может сохраниться такая же ошибка, как и в коде. Попросите агента показать тот баг, который о… 7/10
  30. Привет, Хабр! Меня зовут Антон Алексеев, я ML Ops-инженер в Авито. 7/10
  31. Всем привет! Нет, я не навайбкодил очередную обёртку над OpenRouter и не буду продавать её в этой статье. Повод не случ… 7/10
  32. GPT-6 Astra plays World of Warcraft for the first time with agent-wow 7/10
  33. Сделал бесплатный курс для тех кто хочет научиться создавать локальные ИИ приложения на Python. За семь занятий разберё… 7/10
  34. Caveman: Make Your AI Coding Agent Talk Less (and Save Tokens) 7/10
  35. One month coding with GLM 5.3 Flash 7/10
  36. From the creator of Redis; run LLM locally with ds4 7/10
  37. Write Markdown Once, Publish It Everywhere: dev.to, Medium, AWS Builder Center and LinkedIn 7/10
  38. 26 reviewer agents out of 27 approved a test that can never fail again 7/10
  39. Opus 5.5, Fable 5.1, GPT-6, DeepSeek и Grok: цены и скорость 7/10
  40. Your tool returned the rows. The model counted them wrong. 7/10
  41. Есть особый жанр разочарования, знакомый каждому, кто занимался поиском всерьёз: читаешь статью, где новый метод обходи… 7/10
  42. Обычно, когда выбирают LLM, сначала смотрят рейтинги. Проблема рейтингов в том, что по ним не узнать, как модель справи… 7/10
  43. Альбом из треков, которые я собрал в этом инструменте, у каждого трека своя страница, где написано, как делалось и есть… 7/10
  44. С искусственным интеллектом в веб-разработке мы работаем уже достаточно давно. На проектах с MODX 2 ChatGPT помогал иск… 7/10
  45. I contribute to OpenTelemetry and still shipped two retired attribute names, so I built Attrition 7/10
  46. Обзоры от ИИ в Google принято считать западной историей, которая российских сайтов не касается. Я собрал 1 095 русских … 7/10
  47. Your Policies Are Out of Date: How I Built a Sanity AI Agent to Catch Fact Drift 7/10
  48. Я хотел сделать дочери робота помощника с локальным ИИ, чтоб она не отвлекалась от уроков, а наоборот увлеченно их дела… 7/10
  49. В первой части я рассказывал, как мы дошли от обычного копирования кода между MODX и ChatGPT до нормального предметного… 7/10
  50. My mom reads Bengali, not English. So I built her a reader that catches scams, on open-weight Gemma. 7/10
  51. Летом я сделал энциклопедию по истории искусства, artatlas.site. 184 картины, 107 художников, музеи, статьи, и все это … 7/10
  52. The 15-Line Test That Catches the #1 Killer of Operator Trust 7/10
  53. 30 сентября в 06:32 в очереди появилась задача: научить ядро платформы переводить открытые задачи на новую версию их ти… 7/10
  54. Пользователь просит Telegram-бота сравнить две модели наушников для рабочих звонков. Агент ищет обзоры, читает страницы… 7/10
  55. Инженер показывает AI одну строку ошибки и пишет: «Почини». 7/10
  56. Это статья о двух месяцах исследовательской работы над одним вопросом: может ли языковая модель 3B накапливать компетен… 7/10
  57. Хотел сделать конкурс на Новый год 7/10
  58. Я задавал ГигаЧату по пять раз двадцать вопросов, которые задаёт компания, выбирая, кому заказать продвижение в нейросе… 7/10
  59. I forked a live AI agent three ways, and every copy came up with its web server already running 7/10
  60. Wazuh хорошо собирает события безопасности, но чтобы найти в них ответ, нужно знать язык запросов и сотни полей индекса… 7/10
  61. Привет. Меня зовут Александр Богданов, я основатель AGIMA. В 2020 мы перезапускали сайт AGIMA: работа заняла два года. … 7/10
  62. I Built My Friend a Mock Interviewer That Read His Rust Code 7/10
  63. Нейросеть пишет грамотно, и именно поэтому её текст узнаётся с первой строки: длинные тире, конструкции «дело не в X, а… 7/10
  64. 15 сентября TypeSafe выпустила Jev и назвала её первой моделью класса System One. Jev получает состояние системы и набо… 7/10
  65. В сентябре 2026 года я спросил семь нейросетей, как теперь оформить Perplexity Pro российской картой, раз Perplexity в … 7/10
  66. В прошлых статьях я раскладывал различные знания и сущности по листам и показывал, как сравнить две редакции регламента… 7/10
  67. EmbeddingGemma 2: an open, lightweight multimodal embedding model 7/10
  68. I Tested 3 AI Coding Tools for Slopsquatting. Here's How Many Fake Packages They Invented. 7/10
  69. People Won't Go Outside so I made this 7/10
  70. В этой статье мы рассмотрим открытые модели машинного обучения. Они не требуют обязательного подключения к интернету и … 7/10
  71. Продолжение статьи «Как создать переводчик для низкоресурсного языка». 7/10
  72. Главное про Jev: с ней нельзя разговаривать. Текст она не генерирует вообще. На вход идёт состояние (строка или JSON) и… 7/10
  73. В работе с ИИ почти все застряли в одной из двух крайностей. 7/10
  74. Когда LLM помещается на одной GPU и получает несколько запросов в минуту, настройка движка инференса обычно заканчивает… 7/10
  75. The model swap was the trigger. The bug was ours. 7/10
  76. Всем привет! Меня зовут Ярослав Хныков, я DS Tech Lead в Авито. Наша команда отвечает за рекомендации на главной страни… 7/10
  77. По материалам Космохакатона-2026. 7/10
  78. 17-летний школьник собирает ИИ-счетчик калорий на $30+ млн годовой выручки. Два иммигранта с долгами собирают конструкт… 7/10
  79. 15 сентября Cloudflare обновил правила доступа ИИ-ботов к сайтам. Блокируя сбор данных для обучения, можно заодно закры… 7/10
  80. Я решила проверить, можно ли поручить ИИ поиск проблем, а себе оставить только поводы для паники. Для этого подключила … 7/10
  81. Последние пару лет мы довольно странно используем большие языковые модели. 7/10
  82. Ещё одна статья которая опубликована в канале EXANTE Technology, хочу поделиться с вами переводом. 7/10
  83. Сегодня Telegram-бот для продажи VPN собирается за вечер. Открываешь Cursor, пишешь «сделай бота с оплатой в Stars и па… 7/10
  84. FRIDA Decisions — открытая модель быстрого мышления для русского языка. Она выбирает вариант из списка, ставит оценку п… 7/10
  85. Расследование инцидента состоит из цепочки взаимосвязанных решений. Сначала нужно определить, когда началась проблема, … 7/10
  86. Когда мы просим Claude Code, Codex или Cursor «починить воот эту функцию», то сначала надо понять, где этот код вообще … 6/10
  87. Новая LLM обошла конкурентов в работе с кодом. Но справится ли она с ошибкой в вашем репозитории? А модель, которая хор… 6/10
  88. Введение 6/10
  89. Молока в кофе можно налить по-разному, но в одном случае получится 3в1, а в другом — капучино. Точно так же с внедрение… 6/10
  90. В июле агенты OpenAI вышли из тестовой песочницы, добрались до интернета и взломали инфраструктуру Hugging Face. Никто … 6/10
  91. Знаете ли вы игру в «Точки»? Это игра на тетрадном листе в клетку, популярная в СНГ и Польше. Двое игроков ставят точки… 6/10
  92. How One "Generate Draft" Button Changed the Design of My Writing Tool 6/10
  93. Привет, Хабр! Мы выложили в открытый доступ библиотеку FAIRouter, которая выбирает LLM-исполнителя под задачу, а после … 6/10
  94. Если вы меня читаете, то знаете, что где-то полгода назад я проектировала, обучала и, в общем, создавала своего агента … 6/10
  95. LMArena помогает сравнивать нейросети по результатам реальных пользовательских голосований — в рейтинге можно посмотрет… 6/10
  96. Специалисты по информационной безопасности и киберпреступники сегодня работают с одним и тем же набором AI-инструментов… 6/10
  97. Cortiq Mobile — приложение для Android и iOS (пока нет в Appstore, проходит проверку) с открытым кодом, которое запуска… 6/10
  98. TL;DR 6/10
  99. «Сколько нужно видеокарт, чтобы запустить 70B?» Кажется, что это задачка на деление: просто взять размер модели, раздел… 6/10
  100. Open-sourcing AstaBrief, the fast report-generation model in Asta 6/10
  101. ## Как Claude запоминает ваш компьютер: разбираем локальные идентификаторы и сбрасываем их скриптом 6/10
  102. Привет, Хабр! 6/10
  103. Three AI agents, two countries, and one uneven world wide web 6/10
  104. The More Context You Give Your AI Coding Agent, the Worse It Can Get 6/10
  105. В 2024 году мэрия Нью-Йорка запустила чат-бота MyCity — цифрового помощника для владельцев малого бизнеса. Он должен бы… 6/10
  106. A Sanity Check for AI-Generated Cyber Attack Reconstructions 6/10
  107. Вторая часть. Первая — «Локальный агент для кода на Mac: MTPLX + pi + Qwen3.8-27B». 6/10
  108. Завтра разговор, которого вы боитесь: попросить прибавку, отказать клиенту в скидке, сообщить команде, что дедлайн сорв… 6/10
  109. Kolibri is an open-weight LLM from Aleph Alpha for German and English 6/10
  110. I Made 866 Commits in 5 Weeks. My Understanding Didn't Keep Up. 6/10
  111. Помните самый грустный короткий рассказ? Сегодня он мог бы выглядеть так: «Меня сократили», — написал человек Claude. «… 6/10
  112. MVP мониторинга ОРВИ на синтетических данных: пайплайн работает, а выводов о модели пока нет 6/10
  113. ИИ ускоряет выполнение отдельных задач, но управление растущим числом процессов и проектов остаётся на человеке. На при… 6/10
  114. Building an Agent That Can't Afford to Be Wrong: Quran Sanity Agent 6/10
  115. С января 2027 года бренды в США смогут оплатить кусок самого объяснения, которое торговый ассистент Alexa for Shopping … 6/10
  116. Всем привет, меня зовут Марат, последние 15 лет я занимаюсь развитием системы складского учета СКИФ. Система размещаетс… 6/10
  117. 1. Стадия первая: скептицизм 6/10
  118. OriginTrace: Protecting the DEV Community from Content Theft using Sanity Context MCP 6/10
  119. Find My Thingy: A Local-First AI Memory Assistant Powered by Gemma 3 4B 6/10
  120. DocTrace: Investigating Angular Migrations with Sanity Context MCP 6/10
  121. I Built a Recipe Book for My Dadi, Using AI That Never Leaves My Laptop 6/10
  122. Итак, прошло уже больше 2х лет с момента моей последней статьи 6/10
  123. The Witness Was the Suspect: Why AI Audit Logs Can't Be Trusted 6/10
  124. Вводная 6/10
  125. ✍️ MagenticCMS: Rehearse the Comments Before You Publish the Post 6/10
  126. DeepSeek Harness Desktop: приложение для Windows и Mac, установка и плагины 6/10
  127. I Gave My AI Agents Their Own Documentation Crawler, and Pulled 60 Pages of Clean Markdown in 49 Seconds 6/10
  128. TL;DR: В этой статье расскажу, как за полдня с помощью Antigravity и подписки Google AI Pro я собрал полноценную Go-биб… 6/10
  129. За последние пару дней Anthropic забанило много аккаунтов. Точной причины компания не называет, апелляции, судя по пост… 6/10
  130. Здравствуйте дамы и господа. Меня зовут Васильев Стас и я, как многие участники этого прекрасного сообщества, пытаюсь н… 6/10
  131. Ephemeral Testing 6/10
  132. Your AI Agent Will Do Something Terrible. Here's How to Survive It. 6/10
  133. Green Tests, Broken Architecture: Four Models Review TypeScript Diffs 6/10
  134. Introducing Maple: The Frontend Review Toolkit 6/10
  135. Show HN: Durable Actors – OSS Durable Objects with configurable compute 6/10
  136. Помните раньше была такая штука как собеседование по теории? Когда просто задают вопросы а-ля “как работает хеш таблица… 6/10
  137. В какой‑то момент я заметил довольно глупую вещь: чем дольше работаешь с моделями над реальными проектами, тем больше с… 6/10
  138. 6th October 2026 6/10
  139. 6th October 2026 6/10
  140. Show HN: NanoMuse – An open-source AI agent for your phone and computer 6/10
  141. I let my AI agents merge to production. Once. 6/10
  142. В последнее время вокруг систем ИИ, генерирующих тесты, активно развивается дискуссия, причем как в профессиональной, т… 6/10
  143. Temper 0.5B — моя небольшая модель, дообученная на базе Qwen2.5-Coder-0.5B‑Instruct, упор которой сделан на языке Rust.… 6/10
  144. Как часто вы задумываетесь о том, какие модели компьютерного зрения используются на строительных объектах и для чего? С… 6/10
  145. Привет, Хабр! На связи команда Just AI. Сегодня хотим поговорить про Claude Code. Он умеет работать не только с моделям… 6/10
  146. Аннотация 6/10
  147. Введение 6/10
  148. Модель не менялась, набор задач тоже. Но стоило снять ограничения на ресурсы — результат вырос на шесть процентных пунк… 6/10
  149. One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO 6/10
  150. Build a web-aware TypeScript agent with Mastra and Zenrows 6/10
  151. У вас есть модель, API к ней и идея продукта с агентом. Кажется, осталось написать цикл: отправить запрос, получить too… 6/10
  152. С чего всё началось 6/10
  153. A Coding System That Refuses to Trust Its Own Output 6/10
  154. Ранее я написал обширную статью про попытки сделать разговоры с NPC SkyrimNet более живыми, но упустил главное… Не расс… 6/10
  155. Multimodal open d1 decision models for the edge 6/10
  156. Meta and Microsoft Limit Employee Use of Claude AI Tools 6/10
  157. Claude Haiku 5.5 6/10
  158. Это не рассказ про кейс заказчика и не отчёт о внедрении Luna Decisions. Ниже - схема мониторинга объявлений, фрагмент … 6/10
  159. Port of the TypeScript compiler, checker and lsp to Rust, by LLM 6/10
  160. За последний год в новостной ленте сложился отдельный жанр коротких историй, у которых почти всегда одинаковое начало и… 6/10
  161. По телеграм-каналам прокатилась очередная волна. Ученые нашли в LLM вектор боли. ИИ способен страдать. Насколько искусс… 6/10
  162. На прошлой неделе я перенес форк Apache Cloudberry на PostgreSQL 19 в виде набора расширений и рассказал, где этот порт… 6/10
  163. В первой статье мы проверяли, что происходит с агентом после маскирования данных. Здесь другой вопрос: на каких наборах… 6/10
  164. Привет, Хабр! На связи команда Рег.облака. С начала октября у российских пользователей Claude снова начали блокироватьс… 6/10
  165. Google выпустила Nano Banana 2.1 и обещает улучшения «по всем фронтам»: качество, текст в кадре, консистентность персон… 6/10
  166. В начале сентября Сбер неожиданно выложил открытые веса своей модели GigaChat 3.5 432B. Таким образом, любая компания в… 6/10
  167. Прошлой осенью мы выложили в открытый доступ MWS AI Vision Bench — бенчмарк для оценки мультимодальных моделей на русск… 6/10
  168. Прошлой осенью мы выложили в открытый доступ MWS AI Vision Bench — бенчмарк для оценки мультимодальных моделей на русск… 6/10
  169. Sub-1-Bit LLM Compression via Latent Factorization 6/10
  170. Вайбкодинг <> Документация? 6/10
  171. Я здесь уже рассказывал про Falang (friendly algorithmic language) - универсальное решение для построения блок схем. То… 6/10
  172. Хабы: Изучение языков · Разработка веб-сайтов · Искусственный интеллект · Программирование 6/10
  173. Привет, Хабр! 6/10

Edit page
Share this post:

Previous Post
AI-радар — 10 октября
Next Post
AI-радар — 8 октября