Главное за день
Практические проекты показывают, что полезность ИИ зависит не только от модели, но и от качества контекста, проверок и измерений на собственных данных. Статистику, источники и расходы лучше контролировать отдельно от генерации текста.
Практика
Как MWS документирует таблицы с помощью LLM
8/10Для описания таблиц дополняйте схему контекстом и проверяйте состав промпта на разных типах таблиц.
MWS Data Scout применяет LLM для документирования таблиц баз данных. Ручной эксперимент с Resource Inventory дал 310 описанных витрин за три месяца силами семи сотрудников; на одну таблицу уходило до шести часов. Команда добавила примеры данных, классификацию, доменные знания и глоссарии и выяснила, что лишняя нерелевантная документация может ухудшить результат.
Спортивные обзоры без выдуманной статистики
8/10Считайте статистику программно, а текст ИИ проверяйте по исходным данным перед публикацией.
Автор создал Full Court Press — зин с обзорами матчей WNBA. Код считает показатели по ходу игры и сверяет числа и имена в тексте, который пишет ИИ. Проверки выявляли ошибки; если генерация не удаётся, код публикует простой обзор с соответствующей пометкой.
OenoBench: проверка знаний моделей о вине
8/10При сборке специализированного бенчмарка агентами вручную проверяйте происхождение фактов и работу скраперов.
Автор создал OenoBench из 38 104 фактов, собранных 35 скраперами, и 3 266 вопросов с выбором ответа. В генерации вопросов участвовали пять моделей, в аудите — десять агентов; затем автор проверил 16 моделей. Расходы на API составили около $800, а опыт показал пределы автоматической проверки источников и качества данных.
Какие сайты цитируют поисковые ИИ
8/10Проверяйте цитируемые площадки в своей нише, но не путайте ссылки с полным списком прочитанных источников.
Автор задал пяти поисковым ИИ 20 вопросов о покупке услуг продвижения и изучил ссылки в ответах. Из 211 доменов 161 встретился лишь у одной системы, а 17 цитировались тремя и более. Через шесть недель девять из этих 17 доменов снова оказались общими для трёх и более систем.
GitLab-агент проверяет задачу между сервисами
8/10Для межсервисного ревью анализируйте связанные с задачей изменения, а не только diff одного merge request.
Автор построил ИИ-ревьюера для GitLab, который рассматривает задачу и затронутые ею репозитории вместе. По его сообщению, это помогло находить межсервисные проблемы и сократило время ревью на 80%. Решение опирается на механизмы GitLab и предназначено именно для этой платформы.
Исследования
Цена русского текста зависит от токенизатора
7/10Сравнивайте стоимость моделей на типичных текстах продукта, а не только по цене миллиона токенов.
Автор сравнил 11 токенизаторов на русских и английских текстах. В приведённом сравнении одного русского текста Claude Opus 5 насчитал в 3,9 раза больше токенов, чем GPT-5.5. Поэтому даже при равной цене токена расходы на обработку текста могут заметно различаться.
Как калибровать уверенность классификатора Jev
7/10Перед автоматической маршрутизацией подбирайте порог уверенности отдельно для каждой схемы классов.
Автор провёл 22 эксперимента с Jev и контрольными моделями OpenAI, отправив около 160 тысяч запросов. Он проверял применимость оценок уверенности, а также влияние числа классов, длины контекста, загрязнения входа и языка. Вывод для интеграции: порог уверенности нельзя без проверки переносить между схемами классов.
Все кандидаты выпуска (171)
- Привет, Хабр! Меня зовут Сергей Третьяков. Я product owner MWS Data Scout — сервиса, который описывает таблицы баз данн… 8/10
- Can AI Write a Sports Recap Without Making Up Stats? Mostly. 8/10
- В феврале я решил измерить, сколько языковые модели на самом деле знают про вино. Умеют ли они поддержать разговор о Бо… 8/10
- Я задал пяти нейросетям с включённым поиском 20 вопросов покупателя услуги продвижения и выписал домены из ссылок под о… 8/10
- AI-ревьюер для GitLab, который проверяет не отдельный merge request, а всю задачу сразу, во всех сервисах, которые она … 8/10
- У нашего ИИ-оркестратора более девяноста инструментов: работа с таблицами, документами, почтой, задачами, веб-страницам… 8/10
- Я сделала для своего продукта MCP-сервер. Написание и проверка кода заняла один вечер — писал конечно агент. 8/10
- Show HN: Made an open-source Lego AI generator 8/10
- The BMW manual was off-limits, so I built my friend something better 8/10
- «Срок гарантии — 18 месяцев». Красивый ответ. А если в договоре написано 12? Или число 18 стоит в разделе о хранении, а… 8/10
- Привет! Я Анастасия Никулина, руковожу отделом контента в IT-компании. Кроме продуктовой редакции, на мне SEO-блоги трё… 8/10
- В четверг был звонок на 57 минут, восемь человек. Голоса собеседников Nemotron разметил за 7 секунд. Мой микрофон тогда… 8/10
- I built my friend a Gemma-powered mock interviewer that talks back, entirely in the browser 8/10
- My friend runs her supplements shop from WhatsApp voice notes, so I built her a shop helper 8/10
- Сейчас у нас, как и почти везде, идёт переход на ИИ: каждому сотруднику пытаются выдать своего ИИ-агента. Очень быстро … 8/10
- Вечером я дописал на ноутбуке кусок проекта, утром сел за пк и начал объяснять ассистенту, что вчера было сделано. Втор… 8/10
- I Built an AI That Reads Eviction Notices and Refuses to Lie to You 8/10
- GitHub переписал движок своего ИИ-помощника Copilot. Получилось 832 378 строк нового кода, не считая тестов. Большинств… 8/10
- Publishing Markdown to Substack from an Agent Skill 8/10
- За последние 2 месяца я протестировал RTX PRO 6000 96GB / RTX4090 48GB и даже H200, оценивая варианты для селф-хоста, к… 8/10
- Бывает так, что ревьюер посмотрел пул-реквест, тесты зелёные, компиляция прошла успешно, а в коде всё равно остался баг… 8/10
- В прошлой статье я рассказывал, как устроено ядро нашего поиска: триграммы, crc32, словарь болей и два сита. В конце бы… 8/10
- Я в основном пользуюсь Claude Code и Codex. Во время работы с одним агентом постепенно накапливаются полезные знания: м… 8/10
- Всем привет! Меня зовут Костя, я QA-инженер в Банки.ру. Общение с агентом у меня давно стало обыденным делом. И в какой… 8/10
- Write Like It's 1866: LLMs Relearn Telegraphese 8/10
- Если в пути импорта в CLAUDE.md есть пробел, Claude Code обрывает путь на нём, файл не грузится, а ошибки нет. Так у ме… 8/10
- Большая часть материалов про Claude Code написана под macOS и Linux. У меня часть задач завязана на Windows, в первую о… 8/10
- Я несколько раз попадал в длинные очереди за бензином, конкретно за АИ‑95. В конце августа четыре часа простоял в очере… 8/10
- Цены на API языковых моделей публикуют за миллион токенов, и по этой цифре модели обычно сравнивают. Но «токен» у каждо… 7/10
- В работе с моделями важно не только знать их точность, скорость и цену, но и понимать, где им можно доверять, а где нуж… 7/10
- Первая спецификация CSS вышла в 1996-м. С тех пор мы примерно тридцать лет старались сделать интерфейсы красивыми: доба… 7/10
- The Most Useful Line on Your AI Cost Report Is the One You Can't Explain 7/10
- Тёплое интро это моя валюта обмена. 7/10
- Исследователи из NVIDIA, MIT и NTU поручили одному ИИ-агенту улучшать программу, в которой работает другой ИИ-агент, ко… 7/10
- «Просто напишите правильный промпт», говорили они 7/10
- В прошлой статье я рассказывала, как с помощью GPT-6 Astra и Blender сделала 3D-анимацию вращающейся настольной лампы. … 7/10
- AutoSynthData: Generating Training Data for Enterprise Agents 7/10
- Утро началось с того, что ко мне в личку пришел друг и спросил: «Кто это такой, этот Jev? Ты работаешь с ИИ, должен зна… 7/10
- В зелёном тестовом наборе может сохраниться такая же ошибка, как и в коде. Попросите агента показать тот баг, который о… 7/10
- Привет, Хабр! Меня зовут Антон Алексеев, я ML Ops-инженер в Авито. 7/10
- Всем привет! Нет, я не навайбкодил очередную обёртку над OpenRouter и не буду продавать её в этой статье. Повод не случ… 7/10
- GPT-6 Astra plays World of Warcraft for the first time with agent-wow 7/10
- Сделал бесплатный курс для тех кто хочет научиться создавать локальные ИИ приложения на Python. За семь занятий разберё… 7/10
- Caveman: Make Your AI Coding Agent Talk Less (and Save Tokens) 7/10
- One month coding with GLM 5.3 Flash 7/10
- From the creator of Redis; run LLM locally with ds4 7/10
- Write Markdown Once, Publish It Everywhere: dev.to, Medium, AWS Builder Center and LinkedIn 7/10
- 26 reviewer agents out of 27 approved a test that can never fail again 7/10
- Opus 5.5, Fable 5.1, GPT-6, DeepSeek и Grok: цены и скорость 7/10
- Your tool returned the rows. The model counted them wrong. 7/10
- Есть особый жанр разочарования, знакомый каждому, кто занимался поиском всерьёз: читаешь статью, где новый метод обходи… 7/10
- Обычно, когда выбирают LLM, сначала смотрят рейтинги. Проблема рейтингов в том, что по ним не узнать, как модель справи… 7/10
- Альбом из треков, которые я собрал в этом инструменте, у каждого трека своя страница, где написано, как делалось и есть… 7/10
- С искусственным интеллектом в веб-разработке мы работаем уже достаточно давно. На проектах с MODX 2 ChatGPT помогал иск… 7/10
- I contribute to OpenTelemetry and still shipped two retired attribute names, so I built Attrition 7/10
- Обзоры от ИИ в Google принято считать западной историей, которая российских сайтов не касается. Я собрал 1 095 русских … 7/10
- Your Policies Are Out of Date: How I Built a Sanity AI Agent to Catch Fact Drift 7/10
- Я хотел сделать дочери робота помощника с локальным ИИ, чтоб она не отвлекалась от уроков, а наоборот увлеченно их дела… 7/10
- В первой части я рассказывал, как мы дошли от обычного копирования кода между MODX и ChatGPT до нормального предметного… 7/10
- My mom reads Bengali, not English. So I built her a reader that catches scams, on open-weight Gemma. 7/10
- Летом я сделал энциклопедию по истории искусства, artatlas.site. 184 картины, 107 художников, музеи, статьи, и все это … 7/10
- The 15-Line Test That Catches the #1 Killer of Operator Trust 7/10
- 30 сентября в 06:32 в очереди появилась задача: научить ядро платформы переводить открытые задачи на новую версию их ти… 7/10
- Пользователь просит Telegram-бота сравнить две модели наушников для рабочих звонков. Агент ищет обзоры, читает страницы… 7/10
- Инженер показывает AI одну строку ошибки и пишет: «Почини». 7/10
- Это статья о двух месяцах исследовательской работы над одним вопросом: может ли языковая модель 3B накапливать компетен… 7/10
- Хотел сделать конкурс на Новый год 7/10
- Я задавал ГигаЧату по пять раз двадцать вопросов, которые задаёт компания, выбирая, кому заказать продвижение в нейросе… 7/10
- I forked a live AI agent three ways, and every copy came up with its web server already running 7/10
- Wazuh хорошо собирает события безопасности, но чтобы найти в них ответ, нужно знать язык запросов и сотни полей индекса… 7/10
- Привет. Меня зовут Александр Богданов, я основатель AGIMA. В 2020 мы перезапускали сайт AGIMA: работа заняла два года. … 7/10
- I Built My Friend a Mock Interviewer That Read His Rust Code 7/10
- Нейросеть пишет грамотно, и именно поэтому её текст узнаётся с первой строки: длинные тире, конструкции «дело не в X, а… 7/10
- 15 сентября TypeSafe выпустила Jev и назвала её первой моделью класса System One. Jev получает состояние системы и набо… 7/10
- В сентябре 2026 года я спросил семь нейросетей, как теперь оформить Perplexity Pro российской картой, раз Perplexity в … 7/10
- В прошлых статьях я раскладывал различные знания и сущности по листам и показывал, как сравнить две редакции регламента… 7/10
- EmbeddingGemma 2: an open, lightweight multimodal embedding model 7/10
- I Tested 3 AI Coding Tools for Slopsquatting. Here's How Many Fake Packages They Invented. 7/10
- В этой статье мы рассмотрим открытые модели машинного обучения. Они не требуют обязательного подключения к интернету и … 7/10
- Продолжение статьи «Как создать переводчик для низкоресурсного языка». 7/10
- Главное про Jev: с ней нельзя разговаривать. Текст она не генерирует вообще. На вход идёт состояние (строка или JSON) и… 7/10
- В работе с ИИ почти все застряли в одной из двух крайностей. 7/10
- Когда LLM помещается на одной GPU и получает несколько запросов в минуту, настройка движка инференса обычно заканчивает… 7/10
- Всем привет! Меня зовут Ярослав Хныков, я DS Tech Lead в Авито. Наша команда отвечает за рекомендации на главной страни… 7/10
- По материалам Космохакатона-2026. 7/10
- 17-летний школьник собирает ИИ-счетчик калорий на $30+ млн годовой выручки. Два иммигранта с долгами собирают конструкт… 7/10
- 15 сентября Cloudflare обновил правила доступа ИИ-ботов к сайтам. Блокируя сбор данных для обучения, можно заодно закры… 7/10
- Продолжаем эксперемнтировать с 3D-моделлингом. В сегодняшнем эксперименте зарекрутируем таланты ChatGPT 5, чтобы он нап… 6/10
- 10 Internal Inconsistencies in 3 Published Groundwater Surveys 6/10
- Я всем помогал, а в отчёте пусто. Как ИИ-агенты вспомнили за меня полгода работы 6/10
- С приходом ИИ‑агентов в разработку, кода стало больше, а вместе с ним и шума. Пулреквесты растут, держать агента в рамк… 6/10
- Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs 6/10
- Show HN: Graphene – Data analysis toolkit for your coding agent 6/10
- Aweb – Communication for AI Agents 6/10
- Когда мы просим Claude Code, Codex или Cursor «починить воот эту функцию», то сначала надо понять, где этот код вообще … 6/10
- Новая LLM обошла конкурентов в работе с кодом. Но справится ли она с ошибкой в вашем репозитории? А модель, которая хор… 6/10
- Введение 6/10
- Молока в кофе можно налить по-разному, но в одном случае получится 3в1, а в другом — капучино. Точно так же с внедрение… 6/10
- В июле агенты OpenAI вышли из тестовой песочницы, добрались до интернета и взломали инфраструктуру Hugging Face. Никто … 6/10
- Знаете ли вы игру в «Точки»? Это игра на тетрадном листе в клетку, популярная в СНГ и Польше. Двое игроков ставят точки… 6/10
- How One "Generate Draft" Button Changed the Design of My Writing Tool 6/10
- Привет, Хабр! Мы выложили в открытый доступ библиотеку FAIRouter, которая выбирает LLM-исполнителя под задачу, а после … 6/10
- Если вы меня читаете, то знаете, что где-то полгода назад я проектировала, обучала и, в общем, создавала своего агента … 6/10
- LMArena помогает сравнивать нейросети по результатам реальных пользовательских голосований — в рейтинге можно посмотрет… 6/10
- Специалисты по информационной безопасности и киберпреступники сегодня работают с одним и тем же набором AI-инструментов… 6/10
- Cortiq Mobile — приложение для Android и iOS (пока нет в Appstore, проходит проверку) с открытым кодом, которое запуска… 6/10
- TL;DR 6/10
- «Сколько нужно видеокарт, чтобы запустить 70B?» Кажется, что это задачка на деление: просто взять размер модели, раздел… 6/10
- Open-sourcing AstaBrief, the fast report-generation model in Asta 6/10
- ## Как Claude запоминает ваш компьютер: разбираем локальные идентификаторы и сбрасываем их скриптом 6/10
- Привет, Хабр! 6/10
- Three AI agents, two countries, and one uneven world wide web 6/10
- The More Context You Give Your AI Coding Agent, the Worse It Can Get 6/10
- В 2024 году мэрия Нью-Йорка запустила чат-бота MyCity — цифрового помощника для владельцев малого бизнеса. Он должен бы… 6/10
- A Sanity Check for AI-Generated Cyber Attack Reconstructions 6/10
- Вторая часть. Первая — «Локальный агент для кода на Mac: MTPLX + pi + Qwen3.8-27B». 6/10
- Завтра разговор, которого вы боитесь: попросить прибавку, отказать клиенту в скидке, сообщить команде, что дедлайн сорв… 6/10
- Kolibri is an open-weight LLM from Aleph Alpha for German and English 6/10
- I Made 866 Commits in 5 Weeks. My Understanding Didn't Keep Up. 6/10
- Помните самый грустный короткий рассказ? Сегодня он мог бы выглядеть так: «Меня сократили», — написал человек Claude. «… 6/10
- MVP мониторинга ОРВИ на синтетических данных: пайплайн работает, а выводов о модели пока нет 6/10
- ИИ ускоряет выполнение отдельных задач, но управление растущим числом процессов и проектов остаётся на человеке. На при… 6/10
- Building an Agent That Can't Afford to Be Wrong: Quran Sanity Agent 6/10
- С января 2027 года бренды в США смогут оплатить кусок самого объяснения, которое торговый ассистент Alexa for Shopping … 6/10
- Всем привет, меня зовут Марат, последние 15 лет я занимаюсь развитием системы складского учета СКИФ. Система размещаетс… 6/10
- 1. Стадия первая: скептицизм 6/10
- OriginTrace: Protecting the DEV Community from Content Theft using Sanity Context MCP 6/10
- Find My Thingy: A Local-First AI Memory Assistant Powered by Gemma 3 4B 6/10
- DocTrace: Investigating Angular Migrations with Sanity Context MCP 6/10
- I Built a Recipe Book for My Dadi, Using AI That Never Leaves My Laptop 6/10
- Итак, прошло уже больше 2х лет с момента моей последней статьи 6/10
- The Witness Was the Suspect: Why AI Audit Logs Can't Be Trusted 6/10
- Вводная 6/10
- ✍️ MagenticCMS: Rehearse the Comments Before You Publish the Post 6/10
- DeepSeek Harness Desktop: приложение для Windows и Mac, установка и плагины 6/10
- I Gave My AI Agents Their Own Documentation Crawler, and Pulled 60 Pages of Clean Markdown in 49 Seconds 6/10
- TL;DR: В этой статье расскажу, как за полдня с помощью Antigravity и подписки Google AI Pro я собрал полноценную Go-биб… 6/10
- За последние пару дней Anthropic забанило много аккаунтов. Точной причины компания не называет, апелляции, судя по пост… 6/10
- Здравствуйте дамы и господа. Меня зовут Васильев Стас и я, как многие участники этого прекрасного сообщества, пытаюсь н… 6/10
- Ephemeral Testing 6/10
- Your AI Agent Will Do Something Terrible. Here's How to Survive It. 6/10
- Green Tests, Broken Architecture: Four Models Review TypeScript Diffs 6/10
- Introducing Maple: The Frontend Review Toolkit 6/10
- Show HN: Durable Actors – OSS Durable Objects with configurable compute 6/10
- Помните раньше была такая штука как собеседование по теории? Когда просто задают вопросы а-ля “как работает хеш таблица… 6/10
- В какой‑то момент я заметил довольно глупую вещь: чем дольше работаешь с моделями над реальными проектами, тем больше с… 6/10
- 6th October 2026 6/10
- 6th October 2026 6/10
- Show HN: NanoMuse – An open-source AI agent for your phone and computer 6/10
- I let my AI agents merge to production. Once. 6/10
- В последнее время вокруг систем ИИ, генерирующих тесты, активно развивается дискуссия, причем как в профессиональной, т… 6/10
- Temper 0.5B — моя небольшая модель, дообученная на базе Qwen2.5-Coder-0.5B‑Instruct, упор которой сделан на языке Rust.… 6/10
- Как часто вы задумываетесь о том, какие модели компьютерного зрения используются на строительных объектах и для чего? С… 6/10
- Привет, Хабр! На связи команда Just AI. Сегодня хотим поговорить про Claude Code. Он умеет работать не только с моделям… 6/10
- Аннотация 6/10
- Введение 6/10
- Модель не менялась, набор задач тоже. Но стоило снять ограничения на ресурсы — результат вырос на шесть процентных пунк… 6/10
- One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO 6/10
- У вас есть модель, API к ней и идея продукта с агентом. Кажется, осталось написать цикл: отправить запрос, получить too… 6/10
- С чего всё началось 6/10
- Ранее я написал обширную статью про попытки сделать разговоры с NPC SkyrimNet более живыми, но упустил главное… Не расс… 6/10
- Multimodal open d1 decision models for the edge 6/10
- Meta and Microsoft Limit Employee Use of Claude AI Tools 6/10
- Claude Haiku 5.5 6/10
- Это не рассказ про кейс заказчика и не отчёт о внедрении Luna Decisions. Ниже - схема мониторинга объявлений, фрагмент … 6/10
- Port of the TypeScript compiler, checker and lsp to Rust, by LLM 6/10
- За последний год в новостной ленте сложился отдельный жанр коротких историй, у которых почти всегда одинаковое начало и… 6/10
- По телеграм-каналам прокатилась очередная волна. Ученые нашли в LLM вектор боли. ИИ способен страдать. Насколько искусс… 6/10
- На прошлой неделе я перенес форк Apache Cloudberry на PostgreSQL 19 в виде набора расширений и рассказал, где этот порт… 6/10
- В первой статье мы проверяли, что происходит с агентом после маскирования данных. Здесь другой вопрос: на каких наборах… 6/10
- Привет, Хабр! На связи команда Рег.облака. С начала октября у российских пользователей Claude снова начали блокироватьс… 6/10