Для оценки эффективности ИИ уже давно и успешно используют самые разные бенчмарки. Берем модель/агента, выдаем им одинаковый набор задач, считаем долю успешных решений и получаем удобную цифру, по которой можно сравнивать системы между собой.
По результатам используем ту, которая справилась с большим процентом задач. Звучит круто и даже удобно, но, как всегда, есть нюанс: все работает при условии, что сам экзамен составлен правильно. А с этим, как выясняется, бывают проблемы.
Внутри бенчмарка могут оказаться некорректные эталонные ответы, противоречивые условия или правила оценки, которые засчитывают правильное решение как ошибку, и еще много всего, что исказит итоговый результат.
Летом 2026 года исследователи провели независимый аудит четырех бенчмарков для агентов, работающих с внешними инструментами: BFCL v4, τ²-Bench, LiveMCPBench и MCP-Atlas. Эксперты вручную проверили 496 выполненных заданий и в 92 случаях (18,5%) не согласились с автоматической оценкой бенчмарка. Причины оказались разными: от жесткого сравнения с эталоном до нестабильной трактовки критериев самими LLM-судьями.
Еще одно исследование IBM предлагает использовать LLM, чтобы проверять качество самих бенчмарков. Авторы работают с бенчмарками для task-oriented conversational agents — агентов, которые общаются с пользователем и выполняют конкретную задачу рамках заданных правил. Например, оформляют возврат в интернет-магазине или изменяют бронирование.
Сегодня будем разбираться, что там наделали IBM и как так получилось, что у нас появляются бенчмарки для бенчмарков и почему в мире уже вовсю разворачивается мебиус-системы ИИ.
Читать далееЯ делаю полностью работающую реплику пип‑боя для ролевых игр по вселенной Fallout. Сама по себе эта задача тривиальная с инженерной точки зрения, но есть в ней кое‑что, что, возможно, заинтересует пытливые умы. Расскажу, как научил телефон распознавать вейк‑слово, с матюгами заставил правильно работать речевой парсер и сплясал чечётку на полном ассортименте садовых инструментов, связанных с голосовым управлением вещами.
Читать далееГлавное: теперь можно играть, ничего не заводя.
Заходите на locationking.ru и жмите «Сыграть пять раундов без регистрации». Пять известных мест — Москва, Париж, Манхэттен, пирамиды Гизы, Лондон, — и минуты три времени. Аккаунт нужен только чтобы результаты сохранялись.
Об игре читайте в первой статье.
Читать далееТри месяца вместо запланированного одного. 360 попыток запуска модуля VPN, которые заканчиваются таймаутом без единой подсказки в логах. «Осиротевшие» мастер-ключи, которые формально проходят все проверки, но ломают миграцию на ровном месте. И дистрибутив ключей, который отказывается формироваться из-за одного просроченного ММК.
Звучит как список кошмаров сетевого инженера? Это наш реальный опыт перехода с ViPNet Administrator 4-й версии на ViPNet Prime. Без прикрас, с полным набором граблей и неожиданных поворотов. Если вы только собираетесь в этот путь — эта статья сэкономит вам недели работы и несколько седых волос.
Читать далееСостоялся выпуск gswitch 0.6.6 – свободной утилиты для Linux (X11 и Wayland), которая по команде исправляет уже набранный текст в неверной раскладке. Программа не пытается угадывать язык во время ввода: пользователь сам запускает преобразование последнего слова, текста после последнего Enter или выделенного фрагмента.
( читать дальше... )
Привет, Хабр! Мы — Настя, Эвелина и Михаил — бэкенд-разработчики Т-Банка, пишем код на Scala и горим желанием его популяризировать. Мы собираем и агрегируем новости из разных источников, включая Scala Times, блог Petr Zapletal, добавляем дополнительные материалы и собственные комментарии. Мотивацию черпаем из желания развиваться и делиться полученными знаниями.
Всех поздравляем с наступившим сентябрем. Поздравьте учителей, переверните календарь — и вперед, читать наш дайджест!
Приветствуем любую обратную связь! (づ ◕‿◕ )づ
Читать сорок четвертый выпускНегативные тесты часто выглядят убедительно: отправили некорректный запрос, получили 4xx, проверка зелёная. Но такой результат ещё не гарантирует, что сработало именно нужное бизнес-правило. Запрос мог быть отклонён раньше — на уровне авторизации, схемы или другого поля.
В статье разбираем, как проектировать негативные API-тесты так, чтобы они действительно проверяли ограничения: готовить валидные данные, изолировать одно нарушение за раз, проверять структуру ошибки и убеждаться, что после отказа система не изменила состояние.
Разобрать подходНа самом деле, мне нравится UI всей эпохи с 3.0 по 2000. В первую очередь я использую в качестве примера Windows 2000, потому что она хорошо работает на QEMU/KVM, позволяя легко делать скриншоты.
Читать далее24 коллектора, 111 ATS-досок компаний, 345 тестов, ноль API-ключей и ноль ИИ. Windows-exe, который считает совпадение резюме с вакансией и приносит 1–3 живых человека, которым можно написать самому. Внутри — архитектура, три бага, из-за которых я чуть не отправил письма сотрудникам чужих компаний, и раздел «честные ограничения», без которого это была бы реклама.
Читать далееNEVOD это сеть акустических узлов. Узел собираете сами, вешаете на столб или крышу, события смотрите у себя в Home Assistant. Если узлов в районе несколько, появляется общее оповещение.
Репозиторий: github.com/Gfermoto/UAV-radar Лендинг: gfermoto.github.io/UAV-radar Чат: t.me/UAV_radar
На DIY-плате уже считаются три класса БПЛА, есть направление, WebUI, MQTT. Облако не требуется. Локально узел просто слушает сектор и шлёт события в HA. В общую сеть, после подключения, уходит событие, азимут и спектрограмма. Сырой звук и координаты ноды наружу не отдаются.
Железо: Seeed XIAO ESP32-S3 и ReSpeaker XVF3800 (четыре микрофона). Корпус: STL в ENCLOSURE.md. Смета ядра около 10 тыс. руб., список в BOM.md. Как прошить и собрать: FLASH_NEVOD_DIY.md.
Под это железо две прошивки.
Открытый mic (MIT, исходники в репо) даёт Opus по RTSP и WebUI. Им проверяют плату, слушают сад, при желании гонят поток в BirdNET. Релиз v0.3.0.
NEVOD DIY это датчик: подписанный bin, детекция на плате, MQTT/HA, OTA. Ищите теги nevod-diy-*, канал OTA называется diy-ota.
Порядок сборки короткий. Лендинг и README. Заказ по BOM, печать корпуса. Mic, WebUI, RTSP. Потом nevod-diy bin и MQTT в HA. Потом крепление по гайду. Облако и координаты только когда локально уже стабильно.
Собрали напишите в Discussions что купили и как прошло подключение. Акустика зависит от ветра, шума и высоты, один узел квартал не закрывает.
Читать далееВсем привет!
В своих постах мы часто пишем о разных этапах систем распознавания документов (например, тут и тут). Настало время рассказать о еще одной задаче (и нашем решении для нее), которая часто опускается из подробного рассмотрения.
Наверняка каждый из вас хоть раз клал лист в сканер перевернутым (ну или вы очень везучи). Человек в случае такой оказии может повернуть изображение в редакторе или немного повертеть головой, а что делать системе распознавания?
Просто взять и проигнорировать перевернутые изображения нельзя, ведь при обработке больших объемов данных, например, цифровизации архивов, таких изображений может быть множество. При этом попытки запустить OCR-модели на перевернутых строках обычно заканчиваются плачевно – мы получаем случайные последовательности символов.
Давайте разбираться по порядку!
Читать далееЕсли страница открывается за 3 секунды вместо одной, уходит треть посетителей, а при 5 секундах — почти все. При блокировках и нестабильном интернете всё ещё хуже: висят встроенные видео, тяжёлые картинки и сторонние скрипты.
Привет, я Маша, разработчица в команде ITSumma и я собрала в статье 6 несложных мер, которые ускорят сайт даже без глубоких технических знаний.
Читать далееАдминистратор выгружает список активов в Excel, распечатывает ведомость, берёт ручку — и идёт по этажам. На каждом этаже сверяет глазами, что стоит на столе, с тем, что написано на бумаге. Возвращается, вносит пометки руками. Если что-то не сошлось — идёт ещё раз. Через неделю, а то и две, ведомость с галочками и вопросительными знаками ложится на стол ИТ-руководителю.
Большинство компаний проводят инвентаризацию именно так — и это в 2026 году. Об автоматизации все, конечно, слышали, но непонятно, что конкретно менять и в каком порядке.
Читать далееМогут ли нейросети заменить таргетолога при аудите кампаний? Мы в click.ru решили проверить это на практике и устроили эксперимент с пятью популярными российскими и зарубежными моделями.
Из статьи вы узнаете:
Читать далееВ прошлой статье я разбирал флот из тридцати трёх ИИ-агентов и в разделе про энергетику упомянул вскользь: чертёж там рисуется одной функцией сразу в двух форматах. Большинство читателей эту фразу пропустили, а зря — за ней стоит развилка, на которой я потерял недели.
Задача звучит просто. Есть данные — параметры подстанции, состав оборудования, нагрузки. Нужен чертёж: не картинка, а лист формата А3, который инженер откроет в AutoCAD и поправит.
Очевидный путь — взять AutoCAD и рисовать в нём программно. Я так и сделал: подключился к нему из Python по COM и начал водить его снаружи. Работает. Но когда дошло до генерации по данным, выяснилось, что CAD в этой задаче чаще мешает, чем помогает.
Разберу оба пути на живом коде: где COM незаменим, где он тихо врёт, и почему в итоге чертежи у меня генерирует код, не открывающий никакого CAD вообще.
Вот что на выходе — лист, собранный кодом из строки текста с параметрами:
Читать далееПошаговое руководство по развертыванию JupyterLab на GPU-сервере. Рассказываем про настройку JupyterHub, драйверов NVIDIA, безопасности (Nginx/SSL), лимитов ресурсов и мониторинга.
Читать далееСделать фотографию ярче несложно. Сделать это естественно и быстро прямо на планшете — уже интереснее. Именно такую задачу мы решали для камеры KVADRA_T. Нужно было усилить цвета и контраст, не получить перенасыщенную картинку или артефакты и при этом обработать полноразмерный снимок достаточно быстро, чтобы пользователь практически не замечал задержки.
Привет, Хабр! Меня зовут Денис Смирнов, я старший инженер по разработке ПО искусственного интеллекта KVADRA AI в YADRO. В этой статье расскажу, как мы искали нейросеть для автоматической цветокоррекции на планшете KVADRA_T, почему выбрали MSLTNet и как довели ее до работы на реальном устройстве.
Читать далееВ 1951 году Марвин Минский построил первую в мире работающую нейросеть, а через восемнадцать лет он написал книгу, которая убила все финансирование нейросетей на полтора десятилетия. Кстати, эту книгу он посвятил человеку, которого, собственно, она уничтожила.
И это, дорогой Хабр, не то что бы метафора.
Читать далееС середины августа 2026 года у части абонентов «Ростелекома», «Дом.ру», «Таттелекома», SkyNet и «Билайна» одновременно перестал работать зашифрованный DNS от Google и Cloudflare. Не зависал, не подтормаживал, а именно перестал отвечать. Причём ложился он по-разному в зависимости от протокола, и это различие — самое интересное в истории.
Давайте разберём, что именно происходит на проводе, почему DoT и DoH ломаются не одинаково, как это потрогать руками, и что со всем этим делать.
Читать далееОтчёт Директа показал пять конверсий, потом ноль, потом три. Все три запроса вернули 200 OK. Разбор трёх мест, где успешный ответ API не означает, что вы получили нужные данные, что операция выполнилась и что настройка совпала с замыслом.
Читать далее