Habr.com

Syndicate content Хабр
Все публикации подряд на Хабре
Updated: 1 min 40 sec ago

Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve

4 min 49 sec ago

Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента.

Guard стоит на входе/выходе LLM‑приложения. В статье речь про небольшую модель — чуть больше 0.5 Gb. Но она вызывается дважды за один ход диалога, и сначала пользователь ждет, пока guard проверит его запрос перед отправкой в LLM, затем — пока он проверит сгенерированный ответ перед выдачей пользователю.

Моей задачей было ускорить такую небольшую guard‑модель (Locustfile, базовые benchmark‑конфиги и инструкции по воспроизведению экспериментов в репо). Я потестила пять инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — переход бэкбона на Flash DeBERTa.

Про допущенные ошибки, результаты и выводы — о том, как бы я построила подобную работу сейчас — ниже. Надеюсь, это сбережет вам время.

Читать далее

Лень, Modbus и ИИ: как я сделал инструмент, которого мне не хватало на пусконаладке

4 min 49 sec ago

Когда я работал инженером АСУ ТП, мне часто приходилось проверять связь с устройствами по Modbus. Существующие утилиты помогали, но почти в каждой чего-то не хватало. Спустя несколько лет я вернулся к старой идее и с помощью ИИ-инструментов разработал ProtoLink — простой локальный клиент для Modbus TCP и RTU. Рассказываю, как появился проект, что он уже умеет и в какую сторону будет развиваться дальше.

Читать далее

Торговый робот: что нужно для автономной работы с реальными деньгами

10 min 13 sec ago

Материал посвящён разработке программного обеспечения. Саму стратегию и результаты её работы я не раскрываю, инвестиционных рекомендаций здесь тоже нет.

Если стратегия теряет деньги, её не спасут идеальная архитектура, модный стек и сотни автоматических тестов. Можно завернуть убыточный алгоритм хоть в Kubernetes — прибыльным он от этого не станет.

Но верно и обратное. Нормальную торговую идею вполне реально угробить плохой реализацией. Робот пропустил исполнение заявки, перепутал свою позицию с ручной, повторно отправил ордер после сетевой ошибки — и стратегия уже торгует совсем не так, как была задумана.

Недавно я закончил разработку торгового робота для работы через T-Invest API. В этой статье покажу чем боевой торговый продукт отличается от скрипта, который научился отправлять заявки брокеру.

Для меня граница довольно простая.

Если робот работает только тогда, когда пользователь сидит рядом, смотрит в лог и готов в любой момент вмешаться, это ещё не автономная торговля. Это полуавтоматическая система с дополнительным источником стресса.

Боевой продукт начинается тогда, когда можно уйти на встречу или уехать в отпуск и не проверять каждые пять минут, что робот там натворил.

Читать далее

[Перевод] Как мы потеряли $5674 на рекламе приложения и неожиданно начали расти только после ее отключения

14 min 40 sec ago

Почти каждый основатель SaaS или мобильного приложения в какой-то момент приходит к одной и той же мысли: «Может, проблема не в продукте, а просто о нас пока никто не знает?»

Именно с этой идеей разработчик фитнес-приложения GainFrame решил всерьез протестировать платное продвижение. За три месяца он потратил $5674 на рекламу в Apple Search Ads, TikTok и Reddit. Первые результаты выглядели отлично: установки росли, пробных подписок становилось все больше, графики уверенно шли вверх.

Но когда пришло время считать деньги, выяснилось, что почти каждая новая продажа приносит убыток.

Читать далее

Спасибо Mail.Ru за СВОЙ цифровой офис

30 min 7 sec ago

У нас команда примерно из 30 человек. Много лет корпоративная почта Mail.ru на своем домене была бесплатной: ящики, API, общие папки — подключили и работаем.

Потом бесплатный тариф закончился. Первый год обошелся примерно в 60 тысяч рублей. За следующий для 32 пользователей попросили уже 79 552 ₽.

Мы могли заплатить. Но поняли неприятную вещь: число сотрудников почти не изменилось, процессы те же, а счет растет. При этом почтовый архив, клиенты, боты и служебные ящики уже привязаны к поставщику. Переезд откладывается именно потому, что с каждым годом становится сложнее.

Узнать подробности

ИИ-агенты в трейдинге: от рекомендаций к автономному управлению. Разбор тренда, рисков и архитектурных решений

31 min ago

Представьте, что вы сообщаете ИИ-агенту, на какой риск готовы пойти, какие у вас цели по накоплениям на пенсию и когда ваши дети поступят в колледж, а затем позволяете ему управлять вашим инвестиционным портфелем и спокойно спите по ночам.

Читать далее

MCP без облака

31 min ago

У меня возникла такая задача: есть куча файлов, на которые хорошо бы натравить нейросеть, чтобы она искала ответы прямо по ним, а не выдумывала. Файлы разнородные, среди них тяжелые PDF. Закинуть их в модель целиком не выйдет: контекстное окно забьется раньше, чем она доберется до сути. Нужен способ скармливать модели не весь архив разом, а только нужный кусок. Так мне пришла идея применить MCP «с другой стороны» — не для агента, а для аккуратного доступа к большому архиву локальных документов.

Читать далее

[Перевод] Как измерить то, что вы никогда не замечаете

40 min 1 sec ago

Как научить модель понимать пространство по одному уличному снимку и переводить перспективу в измеримые величины?

В статье исследуем этот вопрос на примере ширины тротуаров: восстанавливаем глубину сцены, строим 3D‑представление поверхности и проверяем, насколько точно машинное обучение может описать привычную городскую среду.

Читать далее

MarathonMemBench — бенчмарк нового типа для тестирования памяти вашего LLM-агента

46 min 19 sec ago

Эта статья — про долговременную память AI-агентов и про то, как её измерить. Я сделал MarathonMemBench — платформу, где LLM-персона часами беседует с тестируемым агентом: рассказывает факты о своей жизни, меняет решения, путается и поправляется, а под конец — когда начало разговора давно вытеснено из контекста — устраивает экзамен на всё сказанное. Подключить можно любого агента, у которого есть чат, — больше от него ничего не требуется. Дальше будут: обзор существующих бенчмарков памяти и почему каждый из них требует дорабатывать агента под себя, устройство платформы, результаты open-source-агентов — неожиданно сильные — и вскрытие их памяти после прогонов.

Читать далее

React Update Lifecycle: что происходит при обновлении компонента

49 min 24 sec ago

В этой статье последовательно разобран полный цикл обновления React: от Virtual DOM до внутреннего устройства Fiber Reconciler.

Разобраться в жизненном цикле React

Step-Up Authentication vs 2FA: зачем нужен второй фактор внутри активной сессии

1 hour 1 min ago

Двухфакторная аутентификация давно стала стандартом защиты корпоративных систем. Она надежно защищает процесс входа, но что происходит после того, как сессия уже создана? Современные атаки все чаще направлены не на взлом пароля, а на компрометацию уже активных сессий пользователей. В таких сценариях однократной проверки личности при входе становится недостаточно.

В этой статье мы разберем, чем Step-Up Authentication отличается от классической 2FA, в каких сценариях она применяется и как мы реализовали этот механизм в одном из проектов с помощью отдельного сервиса PIN-кодов и gateway-проверки.

Читать далее

Как перестать переснимать обучающие видео после каждого редизайна

1 hour 5 min ago

У нас было несколько обучающих видео по личному кабинету. После большого редизайна большая часть стала неактуальной: кнопки переехали, разделы переименовали, один экран вообще уехал в другое меню.

Чтобы обновить одно видео, надо открыть OBS, поднять чистый профиль браузера — иначе в кадр лезут закладки и всплывашки. Потом записать дубль, в котором ты ни разу не промахнулся мышкой. Потом порезать в редакторе, наложить подписи. На семь видео уходит день. Через два месяца — опять день.

Предсказуемо, видео перестали обновлять. Тогда я написал штуку, которая собирает ролик из текстового файла.

Читать далее

Обзор PUBG Mobile в 2026 году: стоит ли возвращаться, и какие режимы актуальны

1 hour 8 min ago

PUBG Mobile была и остается одним из самых популярных шутеров в жанре королевской битвы. За последние годы игра приросла новыми форматами и свежим контентом, однако меняющийся с обновлениями интерфейс, множество загрузок и всплывающих окон могут изрядно озадачить геймера, который решит вернуться после долгого перерыва.

В этой статье мы поможем сориентироваться в мобильной PUBG 2026 года и разобраться, какие игровые режимы заслуживают вашего внимания, и стоит ли вообще возвращаться в мир королевских битв после долгого перерыва.

Читать далее

Невероятно быстрый алгоритм нахождения простых делителей огромных составных чисел

1 hour 8 min ago

хочу представить вам свой очень быстрый алгоритм нахождения простых делителей огромных составных чисел. Однажды на уроке математики мне нужно было найти делители какого-то числа. Раз уж "лень — двигатель прогресса", я решил поручить эту задачу компьютеру. Но простая программа на Python по перебору до корня мне показалась скучной, и тогда я решил найти более интересный способ.

Читать далее

Месяц, 500M токенов и симулятор завода: как мы с ИИ-агентом построили имитационную модель производства чипов

1 hour 22 min ago

Когда я прочёл о том, что Андрей Карпати больше не пишет код руками, а перешёл на агентное программирование, я, честно говоря призадумался. Скажи об этом кто-то другой, пропустил бы мимо ушей, но именно его слова стали сигналом - в своей работе, и в группе разработчиков придётся что-то менять. Как известно, личный пример - лучший способ убедить коллектив и повести за собой, поэтому пришлось пробовать.

Первой же пробой пера стал вовсе не Todo-app, а самый что ни на есть хардкорный энтерпрайз. Задача - создать полноценный аналог интеграционной шины CellWorks MBX. Это ключевой элемент автоматизации завода по производству полупроводников: она связывает в единое целое MES-систему и сотню единиц технологического оборудования. Мы как раз начинали перенос легаси-стека с PA-RISC-серверов на x64, и вопрос портирования старого транспорта стоял остро.

Вторым проектом стала имитационная модель этого производства. Нет-нет, это не аналог factorio, в ней ни намёка на 3D или игровые механики. Это симулятор реального цеха: с моделями оборудования, технологическими маршрутами, реальным незавершённым производством, производственным планом на годы вперёд (при желании). Эта модель отвечает на вопрос: какую продукцию и в какой срок я потенциально смогу выпустить, если запущу в работу вот столько-то сырья, и оборудование не встанет надолго из-за поломки или отсутствия материалов. Результат превзошёл ожидания. Софт, который раньше создавался большими коллективами, благодаря ИИ и open-source, теперь можно создавать практически в одиночку, и активно внедрять в реальное производство!

Читать далее

[Перевод] Объяснение диэдральных подгрупп на примере Factorio

1 hour 23 min ago

Диэдральная группа — это математическое обозначение всех поворотов и отражений правильного многоугольника. Для n‑стороннего многоугольника всегда существует n возможных поворотов и n отражений, что даёт нам 2n возможных симметрий.

Сочетание любых двух симметрий даёт нам элемент из той же группы, и это превращает её в группу в математическом смысле.

Теория групп полезна при разработке игр. Я вспомнил об этом, прочитав девлог Factorio, в котором разработчик рассказал о проблемах, возникших из‑за того, что изначально он забыл учесть все случаи.

Читать далее

Как попасть на стажировку в Яндекс

1 hour 31 min ago

Привет! Это команда Яндекс Практикума. 17 июня у нас прошёл открытый вебинар «Как попасть на стажировку в Яндекс» — рекрутер Young&&Yandex Дарья Чикалова рассказала, где искать программы стажировок, как они устроены и как на них подаваться. Пересказываем самое интересное.

Читать далее

«Эллес» и Global Catalog. Как вычерпать наполняющийся бассейн

1 hour 40 min ago

Привет, Хабр! Меня зовут Динар, я один из разработчиков службы каталогов «Эллес» в ГК «Иннотех». Кратко о продукте «Эллес», откуда он взялся и что из себя представляет, писал мой коллега. Подробное описание и документацию можете найти на официальном сайте. Но если коротко, то «Эллес» — это служба каталогов (в основе которой лежит глубоко модернизированный код проекта Samba), функционально аналогичная Microsoft Active Directory, с возможностью работы в гетерогенной среде с бесшовной интеграцией и миграцией клиентов.

Читать далее

Объекты в JS не бесплатные

1 hour 43 min ago

Поговорим про микро-оптимизацию. Про, казалось бы, самую безобидную вещь: обычный {}.

[object Object] выглядит почти бесплатной абстракцией. Создал объект, напихал полей в любом порядке, удалил ненужное, передал дальше и забыл. Но, внезапно, одинаковые для тебя объекты могут оказаться разными для V8, порядок присваиваний влияет на машинный код, а “безобидный” delete оставляет после себя совсем не пустое место.

Для 99% систем это не имеет значения. А вот если у тебя hot path, через который проходят десятки тысяч объектов в секунду, или ты пишешь библиотечный код, стоит знать, что V8 на самом деле делает с твоими объектами.

И чего V8 там делает?

Почему заметки не работают — и как я заменил их пазлами

1 hour 48 min ago

Во время обучения чему-либо часто сталкиваешься с тем, что забываешь, что вообще изучал, особенно детали. Мне 18, я решил 822 задачи на LeetCode со стриком 430+ дней. Количество решённого само по себе ничего не гарантирует, если через пару недель не можешь вспомнить логику без подсказки. Поэтому я решил создать этот проект, но это относится не только к литкоду, но и ко всему остальному.

Начнем с простого. Писать заметки — это вполне рабочий вариант, но здесь есть важный момент: заметки работают эффективно только тогда, когда они заставляют мозг перерабатывать информацию («эффект генерации»), а не просто копировать её.

А теперь подробнее. Начнём с важного заявления психологов Родигера и Карпике, авторов классического эксперимента по retrieval practice: студенты предсказывали, что многократное перечитывание материала даст лучшее долгосрочное запоминание, а активное вспоминание — худшее, хотя на практике всё оказалось ровно наоборот.

Возможно, для многих это очевидно, да? Да, но суть глубже.

Когда человек перечитывает текст несколько раз, при повторном чтении слова "узнаются" легче и быстрее — возникает субъективное чувство беглости (лёгкости обработки). Мозг путает эту лёгкость восприятия с реальным пониманием и прочностью запоминания. То есть "мне легко это читать" ошибочно интерпретируется как "я это знаю". На это важно обратить внимание.

Это работа Роберта Бьорка — он же автор концепции desirable difficulties ("желательных трудностей"): вещи, которые кажутся трудными и медленными в моменте (типа вспоминания без подсказок), реально дают куда более прочное обучение, чем лёгкие и приятные способы (перечитывание).

Читать далее

Who's online

There are currently 0 users and 4 guests online.