Skip to content
Neuronavt
Go back

AI-радар — 8 октября

Edit page
Отобрано 7 из 87 · 5 практик · 2 исследования

Главное за день

Практические проекты показывают, что полезность ИИ зависит не только от модели, но и от качества контекста, проверок и измерений на собственных данных. Статистику, источники и расходы лучше контролировать отдельно от генерации текста.

Практика

Как MWS документирует таблицы с помощью LLM

8/10

Для описания таблиц дополняйте схему контекстом и проверяйте состав промпта на разных типах таблиц.

MWS Data Scout применяет LLM для документирования таблиц баз данных. Ручной эксперимент с Resource Inventory дал 310 описанных витрин за три месяца силами семи сотрудников; на одну таблицу уходило до шести часов. Команда добавила примеры данных, классификацию, доменные знания и глоссарии и выяснила, что лишняя нерелевантная документация может ухудшить результат.

Спортивные обзоры без выдуманной статистики

8/10

Считайте статистику программно, а текст ИИ проверяйте по исходным данным перед публикацией.

Автор создал Full Court Press — зин с обзорами матчей WNBA. Код считает показатели по ходу игры и сверяет числа и имена в тексте, который пишет ИИ. Проверки выявляли ошибки; если генерация не удаётся, код публикует простой обзор с соответствующей пометкой.

OenoBench: проверка знаний моделей о вине

8/10

При сборке специализированного бенчмарка агентами вручную проверяйте происхождение фактов и работу скраперов.

Автор создал OenoBench из 38 104 фактов, собранных 35 скраперами, и 3 266 вопросов с выбором ответа. В генерации вопросов участвовали пять моделей, в аудите — десять агентов; затем автор проверил 16 моделей. Расходы на API составили около $800, а опыт показал пределы автоматической проверки источников и качества данных.

Какие сайты цитируют поисковые ИИ

8/10

Проверяйте цитируемые площадки в своей нише, но не путайте ссылки с полным списком прочитанных источников.

Автор задал пяти поисковым ИИ 20 вопросов о покупке услуг продвижения и изучил ссылки в ответах. Из 211 доменов 161 встретился лишь у одной системы, а 17 цитировались тремя и более. Через шесть недель девять из этих 17 доменов снова оказались общими для трёх и более систем.

GitLab-агент проверяет задачу между сервисами

8/10

Для межсервисного ревью анализируйте связанные с задачей изменения, а не только diff одного merge request.

Автор построил ИИ-ревьюера для GitLab, который рассматривает задачу и затронутые ею репозитории вместе. По его сообщению, это помогло находить межсервисные проблемы и сократило время ревью на 80%. Решение опирается на механизмы GitLab и предназначено именно для этой платформы.

Исследования

Цена русского текста зависит от токенизатора

7/10

Сравнивайте стоимость моделей на типичных текстах продукта, а не только по цене миллиона токенов.

Автор сравнил 11 токенизаторов на русских и английских текстах. В приведённом сравнении одного русского текста Claude Opus 5 насчитал в 3,9 раза больше токенов, чем GPT-5.5. Поэтому даже при равной цене токена расходы на обработку текста могут заметно различаться.

Как калибровать уверенность классификатора Jev

7/10

Перед автоматической маршрутизацией подбирайте порог уверенности отдельно для каждой схемы классов.

Автор провёл 22 эксперимента с Jev и контрольными моделями OpenAI, отправив около 160 тысяч запросов. Он проверял применимость оценок уверенности, а также влияние числа классов, длины контекста, загрязнения входа и языка. Вывод для интеграции: порог уверенности нельзя без проверки переносить между схемами классов.

Все кандидаты выпуска (171)
  1. Привет, Хабр! Меня зовут Сергей Третьяков. Я product owner MWS Data Scout — сервиса, который описывает таблицы баз данн… 8/10
  2. Can AI Write a Sports Recap Without Making Up Stats? Mostly. 8/10
  3. В феврале я решил измерить, сколько языковые модели на самом деле знают про вино. Умеют ли они поддержать разговор о Бо… 8/10
  4. Я задал пяти нейросетям с включённым поиском 20 вопросов покупателя услуги продвижения и выписал домены из ссылок под о… 8/10
  5. AI-ревьюер для GitLab, который проверяет не отдельный merge request, а всю задачу сразу, во всех сервисах, которые она … 8/10
  6. У нашего ИИ-оркестратора более девяноста инструментов: работа с таблицами, документами, почтой, задачами, веб-страницам… 8/10
  7. Я сделала для своего продукта MCP-сервер. Написание и проверка кода заняла один вечер — писал конечно агент. 8/10
  8. Show HN: Made an open-source Lego AI generator 8/10
  9. The BMW manual was off-limits, so I built my friend something better 8/10
  10. «Срок гарантии — 18 месяцев». Красивый ответ. А если в договоре написано 12? Или число 18 стоит в разделе о хранении, а… 8/10
  11. Привет! Я Анастасия Никулина, руковожу отделом контента в IT-компании. Кроме продуктовой редакции, на мне SEO-блоги трё… 8/10
  12. В четверг был звонок на 57 минут, восемь человек. Голоса собеседников Nemotron разметил за 7 секунд. Мой микрофон тогда… 8/10
  13. I built my friend a Gemma-powered mock interviewer that talks back, entirely in the browser 8/10
  14. My friend runs her supplements shop from WhatsApp voice notes, so I built her a shop helper 8/10
  15. Сейчас у нас, как и почти везде, идёт переход на ИИ: каждому сотруднику пытаются выдать своего ИИ-агента. Очень быстро … 8/10
  16. Вечером я дописал на ноутбуке кусок проекта, утром сел за пк и начал объяснять ассистенту, что вчера было сделано. Втор… 8/10
  17. I Built an AI That Reads Eviction Notices and Refuses to Lie to You 8/10
  18. GitHub переписал движок своего ИИ-помощника Copilot. Получилось 832 378 строк нового кода, не считая тестов. Большинств… 8/10
  19. Publishing Markdown to Substack from an Agent Skill 8/10
  20. За последние 2 месяца я протестировал RTX PRO 6000 96GB / RTX4090 48GB и даже H200, оценивая варианты для селф-хоста, к… 8/10
  21. Бывает так, что ревьюер посмотрел пул-реквест, тесты зелёные, компиляция прошла успешно, а в коде всё равно остался баг… 8/10
  22. В прошлой статье я рассказывал, как устроено ядро нашего поиска: триграммы, crc32, словарь болей и два сита. В конце бы… 8/10
  23. Я в основном пользуюсь Claude Code и Codex. Во время работы с одним агентом постепенно накапливаются полезные знания: м… 8/10
  24. Всем привет! Меня зовут Костя, я QA-инженер в Банки.ру. Общение с агентом у меня давно стало обыденным делом. И в какой… 8/10
  25. Write Like It's 1866: LLMs Relearn Telegraphese 8/10
  26. Если в пути импорта в CLAUDE.md есть пробел, Claude Code обрывает путь на нём, файл не грузится, а ошибки нет. Так у ме… 8/10
  27. Большая часть материалов про Claude Code написана под macOS и Linux. У меня часть задач завязана на Windows, в первую о… 8/10
  28. Я несколько раз попадал в длинные очереди за бензином, конкретно за АИ‑95. В конце августа четыре часа простоял в очере… 8/10
  29. Цены на API языковых моделей публикуют за миллион токенов, и по этой цифре модели обычно сравнивают. Но «токен» у каждо… 7/10
  30. В работе с моделями важно не только знать их точность, скорость и цену, но и понимать, где им можно доверять, а где нуж… 7/10
  31. Первая спецификация CSS вышла в 1996-м. С тех пор мы примерно тридцать лет старались сделать интерфейсы красивыми: доба… 7/10
  32. The Most Useful Line on Your AI Cost Report Is the One You Can't Explain 7/10
  33. Тёплое интро это моя валюта обмена. 7/10
  34. Исследователи из NVIDIA, MIT и NTU поручили одному ИИ-агенту улучшать программу, в которой работает другой ИИ-агент, ко… 7/10
  35. «Просто напишите правильный промпт», говорили они 7/10
  36. В прошлой статье я рассказывала, как с помощью GPT-6 Astra и Blender сделала 3D-анимацию вращающейся настольной лампы. … 7/10
  37. AutoSynthData: Generating Training Data for Enterprise Agents 7/10
  38. Утро началось с того, что ко мне в личку пришел друг и спросил: «Кто это такой, этот Jev? Ты работаешь с ИИ, должен зна… 7/10
  39. В зелёном тестовом наборе может сохраниться такая же ошибка, как и в коде. Попросите агента показать тот баг, который о… 7/10
  40. Привет, Хабр! Меня зовут Антон Алексеев, я ML Ops-инженер в Авито. 7/10
  41. Всем привет! Нет, я не навайбкодил очередную обёртку над OpenRouter и не буду продавать её в этой статье. Повод не случ… 7/10
  42. GPT-6 Astra plays World of Warcraft for the first time with agent-wow 7/10
  43. Сделал бесплатный курс для тех кто хочет научиться создавать локальные ИИ приложения на Python. За семь занятий разберё… 7/10
  44. Caveman: Make Your AI Coding Agent Talk Less (and Save Tokens) 7/10
  45. One month coding with GLM 5.3 Flash 7/10
  46. From the creator of Redis; run LLM locally with ds4 7/10
  47. Write Markdown Once, Publish It Everywhere: dev.to, Medium, AWS Builder Center and LinkedIn 7/10
  48. 26 reviewer agents out of 27 approved a test that can never fail again 7/10
  49. Opus 5.5, Fable 5.1, GPT-6, DeepSeek и Grok: цены и скорость 7/10
  50. Your tool returned the rows. The model counted them wrong. 7/10
  51. Есть особый жанр разочарования, знакомый каждому, кто занимался поиском всерьёз: читаешь статью, где новый метод обходи… 7/10
  52. Обычно, когда выбирают LLM, сначала смотрят рейтинги. Проблема рейтингов в том, что по ним не узнать, как модель справи… 7/10
  53. Альбом из треков, которые я собрал в этом инструменте, у каждого трека своя страница, где написано, как делалось и есть… 7/10
  54. С искусственным интеллектом в веб-разработке мы работаем уже достаточно давно. На проектах с MODX 2 ChatGPT помогал иск… 7/10
  55. I contribute to OpenTelemetry and still shipped two retired attribute names, so I built Attrition 7/10
  56. Обзоры от ИИ в Google принято считать западной историей, которая российских сайтов не касается. Я собрал 1 095 русских … 7/10
  57. Your Policies Are Out of Date: How I Built a Sanity AI Agent to Catch Fact Drift 7/10
  58. Я хотел сделать дочери робота помощника с локальным ИИ, чтоб она не отвлекалась от уроков, а наоборот увлеченно их дела… 7/10
  59. В первой части я рассказывал, как мы дошли от обычного копирования кода между MODX и ChatGPT до нормального предметного… 7/10
  60. My mom reads Bengali, not English. So I built her a reader that catches scams, on open-weight Gemma. 7/10
  61. Летом я сделал энциклопедию по истории искусства, artatlas.site. 184 картины, 107 художников, музеи, статьи, и все это … 7/10
  62. The 15-Line Test That Catches the #1 Killer of Operator Trust 7/10
  63. 30 сентября в 06:32 в очереди появилась задача: научить ядро платформы переводить открытые задачи на новую версию их ти… 7/10
  64. Пользователь просит Telegram-бота сравнить две модели наушников для рабочих звонков. Агент ищет обзоры, читает страницы… 7/10
  65. Инженер показывает AI одну строку ошибки и пишет: «Почини». 7/10
  66. Это статья о двух месяцах исследовательской работы над одним вопросом: может ли языковая модель 3B накапливать компетен… 7/10
  67. Хотел сделать конкурс на Новый год 7/10
  68. Я задавал ГигаЧату по пять раз двадцать вопросов, которые задаёт компания, выбирая, кому заказать продвижение в нейросе… 7/10
  69. I forked a live AI agent three ways, and every copy came up with its web server already running 7/10
  70. Wazuh хорошо собирает события безопасности, но чтобы найти в них ответ, нужно знать язык запросов и сотни полей индекса… 7/10
  71. Привет. Меня зовут Александр Богданов, я основатель AGIMA. В 2020 мы перезапускали сайт AGIMA: работа заняла два года. … 7/10
  72. I Built My Friend a Mock Interviewer That Read His Rust Code 7/10
  73. Нейросеть пишет грамотно, и именно поэтому её текст узнаётся с первой строки: длинные тире, конструкции «дело не в X, а… 7/10
  74. 15 сентября TypeSafe выпустила Jev и назвала её первой моделью класса System One. Jev получает состояние системы и набо… 7/10
  75. В сентябре 2026 года я спросил семь нейросетей, как теперь оформить Perplexity Pro российской картой, раз Perplexity в … 7/10
  76. В прошлых статьях я раскладывал различные знания и сущности по листам и показывал, как сравнить две редакции регламента… 7/10
  77. EmbeddingGemma 2: an open, lightweight multimodal embedding model 7/10
  78. I Tested 3 AI Coding Tools for Slopsquatting. Here's How Many Fake Packages They Invented. 7/10
  79. В этой статье мы рассмотрим открытые модели машинного обучения. Они не требуют обязательного подключения к интернету и … 7/10
  80. Продолжение статьи «Как создать переводчик для низкоресурсного языка». 7/10
  81. Главное про Jev: с ней нельзя разговаривать. Текст она не генерирует вообще. На вход идёт состояние (строка или JSON) и… 7/10
  82. В работе с ИИ почти все застряли в одной из двух крайностей. 7/10
  83. Когда LLM помещается на одной GPU и получает несколько запросов в минуту, настройка движка инференса обычно заканчивает… 7/10
  84. Всем привет! Меня зовут Ярослав Хныков, я DS Tech Lead в Авито. Наша команда отвечает за рекомендации на главной страни… 7/10
  85. По материалам Космохакатона-2026. 7/10
  86. 17-летний школьник собирает ИИ-счетчик калорий на $30+ млн годовой выручки. Два иммигранта с долгами собирают конструкт… 7/10
  87. 15 сентября Cloudflare обновил правила доступа ИИ-ботов к сайтам. Блокируя сбор данных для обучения, можно заодно закры… 7/10
  88. Продолжаем эксперемнтировать с 3D-моделлингом. В сегодняшнем эксперименте зарекрутируем таланты ChatGPT 5, чтобы он нап… 6/10
  89. 10 Internal Inconsistencies in 3 Published Groundwater Surveys 6/10
  90. Я всем помогал, а в отчёте пусто. Как ИИ-агенты вспомнили за меня полгода работы 6/10
  91. С приходом ИИ‑агентов в разработку, кода стало больше, а вместе с ним и шума. Пулреквесты растут, держать агента в рамк… 6/10
  92. Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs 6/10
  93. Show HN: Graphene – Data analysis toolkit for your coding agent 6/10
  94. Aweb – Communication for AI Agents 6/10
  95. Когда мы просим Claude Code, Codex или Cursor «починить воот эту функцию», то сначала надо понять, где этот код вообще … 6/10
  96. Новая LLM обошла конкурентов в работе с кодом. Но справится ли она с ошибкой в вашем репозитории? А модель, которая хор… 6/10
  97. Введение 6/10
  98. Молока в кофе можно налить по-разному, но в одном случае получится 3в1, а в другом — капучино. Точно так же с внедрение… 6/10
  99. В июле агенты OpenAI вышли из тестовой песочницы, добрались до интернета и взломали инфраструктуру Hugging Face. Никто … 6/10
  100. Знаете ли вы игру в «Точки»? Это игра на тетрадном листе в клетку, популярная в СНГ и Польше. Двое игроков ставят точки… 6/10
  101. How One "Generate Draft" Button Changed the Design of My Writing Tool 6/10
  102. Привет, Хабр! Мы выложили в открытый доступ библиотеку FAIRouter, которая выбирает LLM-исполнителя под задачу, а после … 6/10
  103. Если вы меня читаете, то знаете, что где-то полгода назад я проектировала, обучала и, в общем, создавала своего агента … 6/10
  104. LMArena помогает сравнивать нейросети по результатам реальных пользовательских голосований — в рейтинге можно посмотрет… 6/10
  105. Специалисты по информационной безопасности и киберпреступники сегодня работают с одним и тем же набором AI-инструментов… 6/10
  106. Cortiq Mobile — приложение для Android и iOS (пока нет в Appstore, проходит проверку) с открытым кодом, которое запуска… 6/10
  107. TL;DR 6/10
  108. «Сколько нужно видеокарт, чтобы запустить 70B?» Кажется, что это задачка на деление: просто взять размер модели, раздел… 6/10
  109. Open-sourcing AstaBrief, the fast report-generation model in Asta 6/10
  110. ## Как Claude запоминает ваш компьютер: разбираем локальные идентификаторы и сбрасываем их скриптом 6/10
  111. Привет, Хабр! 6/10
  112. Three AI agents, two countries, and one uneven world wide web 6/10
  113. The More Context You Give Your AI Coding Agent, the Worse It Can Get 6/10
  114. В 2024 году мэрия Нью-Йорка запустила чат-бота MyCity — цифрового помощника для владельцев малого бизнеса. Он должен бы… 6/10
  115. A Sanity Check for AI-Generated Cyber Attack Reconstructions 6/10
  116. Вторая часть. Первая — «Локальный агент для кода на Mac: MTPLX + pi + Qwen3.8-27B». 6/10
  117. Завтра разговор, которого вы боитесь: попросить прибавку, отказать клиенту в скидке, сообщить команде, что дедлайн сорв… 6/10
  118. Kolibri is an open-weight LLM from Aleph Alpha for German and English 6/10
  119. I Made 866 Commits in 5 Weeks. My Understanding Didn't Keep Up. 6/10
  120. Помните самый грустный короткий рассказ? Сегодня он мог бы выглядеть так: «Меня сократили», — написал человек Claude. «… 6/10
  121. MVP мониторинга ОРВИ на синтетических данных: пайплайн работает, а выводов о модели пока нет 6/10
  122. ИИ ускоряет выполнение отдельных задач, но управление растущим числом процессов и проектов остаётся на человеке. На при… 6/10
  123. Building an Agent That Can't Afford to Be Wrong: Quran Sanity Agent 6/10
  124. С января 2027 года бренды в США смогут оплатить кусок самого объяснения, которое торговый ассистент Alexa for Shopping … 6/10
  125. Всем привет, меня зовут Марат, последние 15 лет я занимаюсь развитием системы складского учета СКИФ. Система размещаетс… 6/10
  126. 1. Стадия первая: скептицизм 6/10
  127. OriginTrace: Protecting the DEV Community from Content Theft using Sanity Context MCP 6/10
  128. Find My Thingy: A Local-First AI Memory Assistant Powered by Gemma 3 4B 6/10
  129. DocTrace: Investigating Angular Migrations with Sanity Context MCP 6/10
  130. I Built a Recipe Book for My Dadi, Using AI That Never Leaves My Laptop 6/10
  131. Итак, прошло уже больше 2х лет с момента моей последней статьи 6/10
  132. The Witness Was the Suspect: Why AI Audit Logs Can't Be Trusted 6/10
  133. Вводная 6/10
  134. ✍️ MagenticCMS: Rehearse the Comments Before You Publish the Post 6/10
  135. DeepSeek Harness Desktop: приложение для Windows и Mac, установка и плагины 6/10
  136. I Gave My AI Agents Their Own Documentation Crawler, and Pulled 60 Pages of Clean Markdown in 49 Seconds 6/10
  137. TL;DR: В этой статье расскажу, как за полдня с помощью Antigravity и подписки Google AI Pro я собрал полноценную Go-биб… 6/10
  138. За последние пару дней Anthropic забанило много аккаунтов. Точной причины компания не называет, апелляции, судя по пост… 6/10
  139. Здравствуйте дамы и господа. Меня зовут Васильев Стас и я, как многие участники этого прекрасного сообщества, пытаюсь н… 6/10
  140. Ephemeral Testing 6/10
  141. Your AI Agent Will Do Something Terrible. Here's How to Survive It. 6/10
  142. Green Tests, Broken Architecture: Four Models Review TypeScript Diffs 6/10
  143. Introducing Maple: The Frontend Review Toolkit 6/10
  144. Show HN: Durable Actors – OSS Durable Objects with configurable compute 6/10
  145. Помните раньше была такая штука как собеседование по теории? Когда просто задают вопросы а-ля “как работает хеш таблица… 6/10
  146. В какой‑то момент я заметил довольно глупую вещь: чем дольше работаешь с моделями над реальными проектами, тем больше с… 6/10
  147. 6th October 2026 6/10
  148. 6th October 2026 6/10
  149. Show HN: NanoMuse – An open-source AI agent for your phone and computer 6/10
  150. I let my AI agents merge to production. Once. 6/10
  151. В последнее время вокруг систем ИИ, генерирующих тесты, активно развивается дискуссия, причем как в профессиональной, т… 6/10
  152. Temper 0.5B — моя небольшая модель, дообученная на базе Qwen2.5-Coder-0.5B‑Instruct, упор которой сделан на языке Rust.… 6/10
  153. Как часто вы задумываетесь о том, какие модели компьютерного зрения используются на строительных объектах и для чего? С… 6/10
  154. Привет, Хабр! На связи команда Just AI. Сегодня хотим поговорить про Claude Code. Он умеет работать не только с моделям… 6/10
  155. Аннотация 6/10
  156. Введение 6/10
  157. Модель не менялась, набор задач тоже. Но стоило снять ограничения на ресурсы — результат вырос на шесть процентных пунк… 6/10
  158. One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO 6/10
  159. У вас есть модель, API к ней и идея продукта с агентом. Кажется, осталось написать цикл: отправить запрос, получить too… 6/10
  160. С чего всё началось 6/10
  161. Ранее я написал обширную статью про попытки сделать разговоры с NPC SkyrimNet более живыми, но упустил главное… Не расс… 6/10
  162. Multimodal open d1 decision models for the edge 6/10
  163. Meta and Microsoft Limit Employee Use of Claude AI Tools 6/10
  164. Claude Haiku 5.5 6/10
  165. Это не рассказ про кейс заказчика и не отчёт о внедрении Luna Decisions. Ниже - схема мониторинга объявлений, фрагмент … 6/10
  166. Port of the TypeScript compiler, checker and lsp to Rust, by LLM 6/10
  167. За последний год в новостной ленте сложился отдельный жанр коротких историй, у которых почти всегда одинаковое начало и… 6/10
  168. По телеграм-каналам прокатилась очередная волна. Ученые нашли в LLM вектор боли. ИИ способен страдать. Насколько искусс… 6/10
  169. На прошлой неделе я перенес форк Apache Cloudberry на PostgreSQL 19 в виде набора расширений и рассказал, где этот порт… 6/10
  170. В первой статье мы проверяли, что происходит с агентом после маскирования данных. Здесь другой вопрос: на каких наборах… 6/10
  171. Привет, Хабр! На связи команда Рег.облака. С начала октября у российских пользователей Claude снова начали блокироватьс… 6/10

Edit page
Share this post:

Previous Post
AI-радар — 9 октября
Next Post
PRIDATOR — платформа автоматизированной торговли на Polymarket