В Казахстане часто смешивают казахский и русский в соцсетях, переписке, быту. Но попробуйте скормить русско-казахскую фразу любой системе машинного перевода (Machine Translation), и она начнёт чудить. Не потому, что она глупая, а потому что данных для обучения моделей переводить такую языковую кашу почти нет.
В этот раз разбираю научную работу коллег из MWS AI и нескольких университетов, в которой они предложили подход для генерации синтетического датасета под эту задачу на базе уже существующих обычных параллельных корпусов на казахском и русском. Да, это синтетические данные, но в условиях, когда альтернативы нет, это спасает. Их модель, обученная на синтетике, обошла известные коммерческие системы (ручная оценка) в узком, но реальном сценарии.
Велком под катВ Казахстане часто смешивают казахский и русский в соцсетях, переписке, быту. Но попробуйте скормить русско-казахскую фразу любой системе машинного перевода (Machine Translation), и она начнёт чудить. Не потому, что она глупая, а потому что данных для обучения моделей переводить такую языковую кашу почти нет.
В этот раз разбираю научную работу коллег из MWS AI и нескольких университетов, в которой они предложили подход для генерации синтетического датасета под эту задачу на базе уже существующих обычных параллельных корпусов на казахском и русском. Да, это синтетические данные, но в условиях, когда альтернативы нет, это спасает. Их модель, обученная на синтетике, обошла известные коммерческие системы (ручная оценка) в узком, но реальном сценарии.
Велком под катС вами снова Илья Вязников, инженер сопровождения СОФРОС. Продолжаю делится практическими приёмами и полезными настройками платформы.
В этой статье разберём, как настроить гибкую систему приоритезации очередей в DATAREON Platform на основе типа данных и дополнительных свойств сообщения.
Читать далееМне нужно было одно число. Какая доля салонов красоты в моём городе даёт клиенту записаться онлайн — без звонка. Я делаю сервис записи для салонов и постоянно слышу от мастеров «нам пишут ночью», «клиенты приходят из интернета». Но сколько всё-таки таких салонов, куда ночью не записаться? Десять процентов? Половина?
Полез искать — и не нашёл. Есть отчёты про объём бьюти-рынка. Есть пресс-релизы CRM про «повальную цифровизацию отрасли». Есть подборки «5 трендов индустрии красоты». А простого числа — у скольких салонов клиент может записаться, не звоня, — нет нигде.
Ну хорошо. Город один, руки есть. Посчитаю сам. Считал два дня, и по дороге выяснил, что самое интересное — не результат, а то, во что упираешься по пути.
Читать далееКогда я начал активно использовать OpenAI Codex для длительных задач, я быстро заметил странный парадокс. Агент способен работать самостоятельно десятки минут, но именно человек продолжает каждые несколько минут проверять терминал: не закончил ли он работу. Я решил поменять эту модель взаимодействия. Вместо того чтобы следить за агентом, агент стал сам сообщать, когда моё участие действительно необходимо.
Читать далееЕсть задачи, которые вроде бы не выглядят тупиком.
Всё уже обсудили, аргументы есть — а решение почему-то снова переезжает на следующую неделю.
Я решил проверить, может ли в такой момент помочь принцип из музыкальной студии 1975 года: слегка нарушить привычный ход разговора.
Читать далееПривет, Хабр! Меня зовут Владимир, и это четвёртая часть цикла статей по написанию и обучению небольшой decoder-only LLM с нуля.
Данная статья целиком посвящена этапу SFT - дообучению на датасете “вопрос - ответ”, чтобы модель могла вести диалог с пользователем, а не просто дописывать за него фразы.
Читать далееВ прошлой статье мы подробно разбирали, как автоматизировать создание чек-листов и ускорить рутинные проверки с помощью нейросетей. Эта практика отлично прижилась на наших проектах: инженеры получили удобный инструмент, который за считанные секунды выдает готовую базу для тестирования задачи и освобождает от необходимости писать первый черновик с нуля. Но со временем вылезла ожидаемая проблема. AI не всегда находил все требования по задаче, иногда додумывал связь между документами, а к части источников у него вообще не было доступа.
В результате следующий промпт получал неполный контекст, а сформированный чек-лист тоже оказывался неполным. И это неприятный случай, потому что внешне чек-лист выглядит аккуратно и уверенно, но какого-то бизнес-правила там просто нет.
При этом цель осталась прежней – сократить время QA на анализ требований. Раньше приходилось руками собирать всё по ссылкам, искать недостающую информацию, проверять версии файлов, находить таблицы с калькуляциями, файлы с эмуляторами и иногда просто выяснять, какой документ сейчас считается актуальным. Поэтому мы пошли на уровень раньше и начали отдельно собирать корпус требований в Codex (но это уже следующая статья). А в данном материале покажу общий подход и несколько правил из промптов, возможно кому-то они пригодятся.
Читать далееСегодня расскажем про книгу для тех, кто устал ждать, пока мир станет стабильным. Она не даст гарантий, но напомнит: великими становятся по собственному выбору.
Джим Коллинз и Мортен Хансен — исследователи в области менеджмента, чьи книги стали классикой деловой литературы — потратили девять лет, чтобы разобраться в одном вопросе: почему в мире, который трясёт, как стиральную машину на отжиме, одни компании выходят сухими из воды и даже процветают, а другие разваливаются на части?
Они взяли предприятия, которые за десятилетия показали результаты в десять раз лучше средних по отрасли, и назвали их «десятикратниками». Для каждой нашли пару — фирму из той же сферы, с такими же возможностями, но которая так и не взлетела. И начали сравнивать. Не умозрительно, а по архивам тех лет: что делали одни и чего не делали другие в одни и те же моменты. И обнаружили, что главные отличия выглядят настолько негероически, что поначалу даже разочаровывают.
Читать далееМы выпустили Manticore Search 28.4.4 . В этом релизе ресоринг KNN стал быстрее, диалоговый поиск — гибче, установка и обновление — проще, фасеты получили дополнительные параметры, появились настройки релевантности по умолчанию на уровне таблицы, а также исправления в аутентификации, репликации, совместимости SQL, распределённых запросах и внутренних механизмах columnar/KNN.
В этом посте собраны изменения, вышедшие с 27.2.0 по 28.4.4.
Читать далееПривет, Хабр.
Уже несколько дней я использую ИИ-агента Codex в своей SMM-системе как участника команды, которому поручаю дела, связанные с работой над планами и контентом.
В этой статье я делюсь своим опытом взаимодействия, показываю конкретные ошибки, которые начали возникать буквально сразу, и решения, помогавшие снизить вероятность их повторения.
SMM-система — не коробочный продукт, а рабочая среда из баз данных и страниц, созданных на платформе Buildin.ai. Это важно, поскольку такая структура определяет возможности платформы и агента в роли исполнителя.
Подключая агента, я хотел:
Читать далееСегодня про EF Core migrations и один очень удобный вызов, который локально экономит время, а в production может связать старт приложения, DDL-блокировки и rollback в одну неприятную историю.
Читать далееDarkGram — гайд по установке: разбираем все рабочие способы
После того как первая статья про DarkGram набрала 9К+ просмотров, самым частым вопросом стало «а как это поставить?». В этом гайде — все актуальные способы установки для iPhone и iPad: через SideStore и TrollStore с разбором плюсов, минусов и подводных камней каждого варианта.
Читать далееПри подаче на катушку индуктивности постоянного тока в катушке формируется магнитное поле. Если во время этого быстро прервать протекание тока в катушке, то это созданное магнитное поле быстро спадает, что может привести к появлению высокого напряжения между выводами катушки индуктивности, вплоть до сотен вольт. Ключевое слово в этом предложении — это слово "может". Далее я попытаюсь объяснить почему, я уделяю этому особое значение.
Обычно в подобных экспериментах и их объяснениях основную роль отдают переменному магнитному полю. При этом само магнитное поле не может приводить электрические заряды в упорядоченное движение, а значит, не может вызывать электрический ток. Также магнитное поле не может разделять электрические заряды, создавая тем самым электрическое напряжение.
Это может делать только электрическое поле, порожденное меняющимся во времени магнитным полем.
То, что переменное магнитное поле создает вихревое электрическое поле, которое и приводит электрические заряды в движение, известно и, это можно сказать ни для кого не секрет (рис.1).
В жизни каждого IT специалиста однажды это случается. Linux-переход. Не надо этого стесняться так как это совершенно естественно. Причины перехода у каждого свои.
На одинаковом железе под Windows и Linux запустил бенчмарки. Получил прирост времени автономной работы с Linux в 30% при кратном сокращении потребления системных ресурсов без потерь производительности.
Предлагаю обсудить карту навигации по GNU/Linux.
Читать далееНа днях, после того, как припекло от Яндекс.Музыки, решила посмотреть, а что со Звуком? Поскольку ожидания были крайне низкими, то звук произвёл весьма положительное первое впечатление. Рассмотрела только web, ведь из AppStore их выпилили. Печаль — тк часть заявленных фичей доступна только в приложении (например, шазам)
Да, звучит странно, но заголовок - не кликбейт, а быстрый ответ, который возможно ты ищешь. Почему-то это ни где не описано и ChatGPT не знает. Я сам выяснил путём экспериментов.
Читать далееЭто вторая часть статьи Путеводитель по чужим STL, возможно будет и третья про разные трюки-хаки с контейнерами, как наберется материал.
Стандартная библиотека плюсов оказалась почти непригодной для игровой разработки и поняли это практически сразу, как попытались её использовать. Крупнейший на тот момент издатель Electronic Arts стал самым известным примером реализации стандартной библиотеки для разработчиков игр (но конечно же были и другие, менее именитые), и силами команд нескольких студий под руководством Paul Pedriana это было претворено в жизнь.
Корни EASTL уходят в Maxis к 1998-му году, когда Пол работая над SimCity 3000, выступал на GDC с докладом «High Performance Game Programming in C++» про кастомные контейнеры, стоимость вызовов и замеры производительности. Единой EASTL тогда ещё не было, но подход, из которого она потом выросла, виден уже там.
До консолидации, даже внутри одной студии, могли существовать несколько параллельных STL-реализаций, разработанных под разные игры, платформы и инструменты. Рискну предположить, что самой полной была реализация от Maxis, как одной из ведущих студий, а в других командах были поменьше, каждая со своими допущениями.
Он же в статьях и докладах упоминал, что EASTL была синтезом практик из этих внутренних вариантов, а не работой одного человека с нуля, и в основе большой EASTL лежит коллективный опыт нескольких инженерных команд, даже если формальным автором финальной публичной версии и статьи остался он один. Конкретные имена соавторов отдельных модулей (аллокаторов, фиксированных контейнеров и т.д.) указаны в репо, но слава досталась Полу.
Читать далееВ наше время радиолюбители вызывают у обывателей в лучшем случае недоумение, а в худшем — стремление сначала набить морду, а после сдать это шпионское отродье в соответствующие органы на опыты. А уж когда кто‑то приходит в управляющую компанию и просит пустить его на крышу, чтобы поставить там антенну... В общем, тем, кто не озаботился установкой антенн в более спокойное время, приходится использовать партизанские решения. Одна из таких антенн — удочка длиной 7–8 метров с проложенным вдоль нее проводом, закрепленная перпендикулярно стене дома на балконе или стене. Провод этот используется либо как четвертьволновой штырь, либо тот или иной вариант диполя, запитываемого с конца. В качестве противовеса используется ограждение балкона или проложенные вдоль стены провода. Эффективность подобных эрзац‑антенн, конечно, невелика, но что делать, в эфире работать хочется. И даже они позволяют проводить интересные связи.
В этой статье я расскажу про свою антенну, ее характеристики и особенности и подниму вопрос ее элементарной грозозащиты.
Читать далееЗа неделю команда бенчмарка Design Arena выпустила два разбора моделей, возглавивших ее дизайн-лидерборды: разбор GPT-5.6 Sol, флагмана OpenAI, и свежий разбор Kimi K3 от китайской Moonshot AI. Исследователи заглянули внутрь генераций и рассуждений моделей и показали, как именно те научились "вкусу". Выяснилось, что универсального рецепта нет: две модели пришли к хорошему дизайну противоположными путями, а третья — прошлый лидер GLM 5.2 — своим, третьим.
Читать далее