Сергей Марков: машинное обучение, искусство и шитпостинг — Telegram channel logo

@oulenspiegel_channel

Сергей Марков: машинное обучение, искусство и шитпостинг

Telegram channel @oulenspiegel_channel: 11.1K subscribers, 2.5K views per post, score 53

Artificial intelligence
53CAhead of 3 in 10 channels in its category
Category midrange 46–67This channel 53
11.1K
Subscribers
2.5K
Median views over 30 days
22.2%
Views / subscribers over 30 days
44
Posts over 30 days

Data as of October 2, 2026

About machine learning, language model research and academic humor mixed with shitposting, written by an AI researcher. The author covers benchmarks, transformer architectures and large language model work, mixing it with personal observations and jokes. As of 30 September: 11.1K subscribers, median post views at 2.3K, and an engagement rate of 21.1 percent, which sits below the category median of 24.1 percent. The posting pace is noticeably higher than what is typical for other channels in the category. Recent material includes a rundown of WebPageBench, a benchmark for evaluating web agents, a preprint on an architectural modification of the transformer that replaces the GEMM operation in the MLP layer, a talk by Alena Fenogenova presenting five lines of Russian-language tests for modern models, and a recorded talk on compression and truth in language model training. An offline conference on Kutuzovsky Prospekt was also mentioned.
catalog description About the channel, by its author
Машинное обучение, искусственный интеллект, искусство, мемасы, всякое личное и странноэ

Common questions

How many subscribers?
Subscribers: 11.1K. Median views per post: 2.5K. Views per subscriber: 22.2%. Measured on October 2, 2026.
How often are posts published?
Posts in the last 30 days: 44 — that is almost every day. Measured on October 2, 2026.
Does this channel have a Telegram tick?
No Telegram tick.
Who runs this channel page in the catalog?
Nobody yet. If this is your channel, claim the page: you will be able to reply to reviews and see its stats.
Is this your channel?

Claim it — accurate metrics, replies to reviews as the channel, and an owner badge on the page.

Verify ownership

Takes a minute: a post with a code, or the bot as an admin
Your page on tg.place

Know the owner?

Forward them this message — they can verify their rights and collect what has piled up: page statistics and replies to reviews.

Subscribers−5 in 37 days
11,10611,063
Oct 211,086+1 in a day

Hover the chart or swipe it — we show the day.

What it is made of
Engagement14.5 of 30
Growth quality9.6 of 20
Reactions and forwards10.5 of 15
Consistency6.6 of 12
Trust3.9 of 8
Reviewsnot enough datano reviews yet

Score 53 — from 5 of 6 signals: the rest are not measured yet. Methodology

Latest posts

Posts are in Russian — that is what the channel publishes.

  • 931Open in Telegram
    🧠 Долгосрочная омнимодальная память Нужный факт может остаться в старом диалоге, быть на фотографии или в прошедшем видео-звонке. Как его вспомнить? Просто складывать всё в один промпт — не хватит контекста. На AI RnD Day наш сотрудник Андрей Безбородов рассказал, как команда сравнивала подходы к памяти для разных доменов и модальностей — диалогов, видео и робототехники. 📌 TLDR В докладе память моделируется через две операции: ingest — принять и сохранить информацию, search — найти эту информацию по запросу. Большое контекстное окно LLM само по себе такой системы не даёт, но служит стартовой отправной точкой. В диалоговых тестах обычный RAG оказался достаточно успешным и сильным решением, причем более сложные схемы не всегда выигрывали. Для других модальностей, типа видео, критично сохранять визуальную информацию, а не только текстовое саммари, иначе теряется смысл, который зачастую нельзя сохранить простым кепшенингом кадров. ⚙️ RAG Длинный контекст разбивают на фрагменты, строят для них векторные представления и по вопросу извлекают подходящие куски. Модель получает не всю информацию, а только таргетные знания. У RAG тоже есть слабые места: сведения могут оказаться на границе фрагментов, а похожий по смыслу факт — быть устаревшим. Найти, что пользователь когда-то любил, и понять, что он любит сейчас, — разные задачи. Результаты: SimpleRAG: На LongMemEval с Qwen3-VL-8B оценка выросла с 41,2% до 50,8%. Подход MemOS дал 53,2%: он хранит память в структуре MemCube, разделяя графовые связи и векторные данные между двумя базами. Однако такую систему сложнее развернуть! Схема SGR + File Tools с циклом "рассуждение → действие → наблюдение" получила 32,2% — ниже обоих вариантов. То есть наличие агента с инструментами ещё не делает память лучше. 🗜 Почему не сжать найденный текст в вектор? В xRAG вместо текста документа в модель передают его вектор через обучаемый проектор. В итоге открытая xRAG-7B незначительно обошла RAG на бенче TriviaQA: 58,9% против 56,1%. На внутреннем бенчмарке команды результат составил уже 8,8% против 50,2% у RAG. Успех на одном домене не перенёсся на другой. 🎬 Видео нельзя без потерь превратить в пересказ WorldMM строит 3 вида памяти: эпизодическую — о конкретных событиях, семантическую — обобщённые факты и связи, визуальную — представления видеофрагментов. Видео режется на клипы по 30c. Qwen-VL описывает кадры, Whisper распознаёт речь. Из описаний формируются тройки вида "объект — отношение — объект", а визуальные представления строит VLM2Vec. Со всеми типами памяти WorldMM оставался примерно на уровне подачи полного контекста. При отключении визуальной памяти оценка падала с 50% до 41%. Важно отметить, что текстовое описание не сохраняет каждую деталь кадра, и это проблема. Нужные редкие детали или события из кадров уже не из чего восстановить. 🤖 А если это память робота? M3 Agent объединяет распознавание лиц, транскрибацию и записи эпизодов на базе Qwen-Omni. На бенчмарке M3-Bench-Robots оценка выросла с 18% до 33% у M3 Agent. Но обработка видео занимала примерно столько же времени, сколько оно длится, а формирование ответа — около 30 секунд. Это очень долго и для роботов может быть неприемлимо. 🔚 Выводы Память стоит выбирать под тип информации и вопросы к ней: поиск по переписке, понимание видео и воспоминания робота требуют разных решений. Начать полезно с простого RAG и сравнения с полным контекстом. Затем можно усложнять систему, когда понятен выигрыш в качестве и его цена по времени. 🔗 Более подробно — в презентации Андрея (в комментариях файлом) и в записи выступления (тайминг: 3:04:55). #memory #RAG #agents #conference #paperwatch
  • 1.2K21 forwards11 reactions5 commentsOpen in Telegram
    🧩 От слов к виджетам Сегодня UI обычно подстраивается под задачу: отдельный экран для покупки, карты, настройки или аналитика. Но с генеративными моделями появляется другой сценарий — интерфейс сам собирается под человека и конкретную задачу, в зависимости от рекомендаций и предпочтений пользователя. На AI RnD Day Ира Пионтковская рассказала, как может выглядеть такой подход и какие технические проблемы возникают на практике. 📌 TLDR LLM пишет код, браузер превращает его в интерфейс. Но кто проверит, что кнопки работают, график не врёт, а виджет отвечает на исходный запрос? Generative UI — это не просто "LLM рисует HTML". Модель должна сгенерировать работающий интерфейс, пользователь — взаимодействовать с ним, а система — понять, действительно ли UI решает задачу с приемлемым качеством. 💥 Красиво ≠ правильно У интерфейса как минимум три слоя проверки: внешний вид, поведение и смысл. Текст может читаться, кнопки — нажиматься, а задача всё равно останется нерешённой. Например, график расходов аккуратно сортирует дни недели по алфавиту. Визуально всё хорошо, а хронология потеряна. 🎙 Почему UI становится частью диалога В классическом интерфейсе пользователь говорит: "покажи шкафы глубиной до 40 см", а приложение показывает экран с результатами. В GenUI модель может создать сам интерфейс под текущую задачу: показать варианты, дать выбрать один, открыть план комнаты и позволить перетащить шкаф. Получается, что виджет становится частью реплики модели — примерно как жест или указание в разговоре. Это особенно интересно вместе с full-duplex voice: пользователь может сказать «этот сюда», модель — показать объект и место на экране, а пользователь — сразу изменить его положение. 🧠 Главная проблема — как проверить UI Сгенерированный HTML может выглядеть красиво, но при этом содержать смысловую или функциональную ошибку. Поэтому мы исследуем VLM-as-a-judge, которая получает запрос, код и скриншоты двух виджетов и должна определить, какой лучше решает задачу. На примере бенчмарка дефектов: берём корректный график и намеренно добавляем один дефект — обрезанный текст, наложение элементов, пропавший объект, подпись не по теме или противоречие с данными. Основной разброс появляется на задачах, где нужно обнаружить ошибку, а не просто прочитать изображение. Например, на обнаружении обрезанного текста Gemini 2.5 Pro дал 100% правильных ответов, GPT-5 — 92%, а Grok 4.20 — 31%. 🛠 Можно ли обучить самого судью? Да. Мы собрали пары из хороших и намеренно испорченных виджетов: перекрытия, блюр, зависания, подмена темы и другие дефекты. Затем дообучили Qwen3.6-35B-A3B. На тесте после DPO точность на повреждённых виджетах выросла с 66% до 100%, а среднее время ответа сократилось примерно с 820 до 25 секунд. 🤖 Следующий уровень — GUI-агент Визуальной проверки недостаточно. Интерфейс может выглядеть правильно, но кнопка не работать. Поэтому следующий шаг — дать GUI-агенту реальный сценарий: "Добавь дубовый шкаф в список покупок". Агент сам кликает по интерфейсу, выбирает нужный объект и проверяет состояние приложения. Если ожидаемый результат не достигнут, траекторию действий и ошибку можно вернуть генератору для исправления. Так появляется полноценный цикл: LLM генерирует UI → GUI-агент взаимодействует → проверяется состояние → ошибка возвращается генератору. 🔚 Выводы Generative UI — это следующий шаг после обычного chatbot-интерфейса: модель может не только отвечать, но и собирать форму взаимодействия под конкретную задачу. Но чтобы это работало в проде, одного сильного генератора недостаточно. Нужны проверяемые среды, модели-судьи и агенты, способные взаимодействовать с интерфейсом. В конечном счёте хочется прийти к системе, где каждой задаче — свой интерфейс, а его качество проверяется автоматически. А после доклада был задан очень хороший вопрос о недалеком будущем: "Будем ли мы жить в одном едином окне, в котором отражена вся наша жизнь?". Кажется, что все к этому идет! 🔗 Более подробно — в презентации Ирины (оставим в комментариях файлом) и в записи выступления (тайминг: 5:04:40). #genui #paperwatch #conference
    Post by “Сергей Марков: машинное обучение, искусство и шитпостинг” from September 30, 2026
  • 1.7K6 reactionsOpen in Telegram
    UPD: конференция пройдёт по адресу Кутузовский проспект, 32 корпус 1
  • 1.6K14 forwards17 reactions8 commentsOpen in Telegram
    🔎 Модель говорит по-русски. А понимает? Пять новых линеек бенчмарков На AI RnD Day наша уважаемая Алёна Феногенова представила 5 линеек русскоязычных тестов для оценки современных моделей. 📌 TLDR Один общий балл в метрике плохо описывает модель для реального применения. Алена рассказала про 5 новых бенчмарков! 1️⃣ LIBRA проверяет работу с длинным контекстом, 2️⃣ MERA Reason — математические рассуждения, 3️⃣ MERA Text 2.0 — языковые, культурные и прикладные навыки, бенчмарки MERA разработаны совместно с Альянсом ИИ. 4️⃣ RUMBA оценивает память между сессиями, а 5️⃣ harness-bench-fast — работу в агентной обвязке: правильно выбрать тул в текстовой задаче и успешно выполнить действие в среде — не одно и то же. Результат зависит от всей связки — модель × обвязка × промпт × окружение. 📚 LIBRA Mini: поместилось в контекст ≠ прочитано Из 18 задач полной LIBRA выбрали шесть сложных и показательных. Диапазон — от 4K до 512K токенов, запуск через lm-evaluation-harness. Здесь мало найти одну фразу: нужно связать факты из разных частей текста, ответить по нескольким статьям Wikipedia, определить человека по теме диалога или посчитать уникальные абзацы среди повторов. Причем, у Qwen3-30B-A3B-Instruct-2507 итоговая оценка падает с 62,2 на 4K до 39,8 на 64K и 12,6 на 128K. Поэтому полезно смотреть не только на максимальное окно модели, но и на то, как меняется качество внутри него. 🧮 MERA Reason Линейка объединяет Luzitania — 251 олимпиадную задачу, TMath — 310 задач с акцентом на комбинаторику, теорию чисел и геометрию, ruAIME — 724 задачи с проверкой точного совпадения ответа. А также MMReD: 128 шагов среды, вход около 8,7K токенов и рассуждение около 20K. Проверяется работа с длинной последовательностью шагов. Все тесты публичные. ⚙️ MERA Text 2.0: где модели ещё различаются В новой версии 12 датасетов и около 8700 запросов — в 4,3 раза меньше прежнего объёма. Четыре группы: человеческая коммуникация, русскоязычный культурный контекст, базовые агентные навыки и рассуждение. Тесты приватные, результаты публикуются на лидерборде. Особенно полезен Agentic-раздел: соблюсти 3–6 формальных требований в одном запросе, преобразовать YAML/CSV/XML целиком, выбрать инструмент из каталога на 14–22 тула. Именно он лучше всего разделяет сильные модели и следующий эшелон. Но это ещё текстовая проверка навыков, не полноценный запуск агента. А понимание регионализмов, мемов и фольклора слабее связано с общим уровнем модели: высокий результат на других задачах его не гарантирует. 🧠 RUMBA: помнить нужно не всё подряд В наборе 85 диалогов и 1543 вопроса. Проверяется извлечение фактов, рассуждение по истории и умение признать отсутствие информации. Есть и временная составляющая: если пользователь сначала любил розы, потом кактусы, а теперь лилии, ответить «розы» — ошибка, хотя такой факт в истории был. Сравниваются два режима: весь диалог во входе и внешняя память/RAG. Простой RAG получает 68,89 по русскоязычной оценке LLM-судьи, memOS — 66,82, mem0 — 53,21. Сложнее — не обязательно лучше. Это сравнение показанных систем, не универсальный рейтинг подходов. 🛠 harness-bench-fast Около 391 кейса на файлы, CLI, инструменты, инструкции, память, программирование и отладку. Результат проверяет код, без LLM-судьи. Заявлен локальный прогон примерно за 30 минут без Docker и без интернета для тестовой среды; есть поддержка Harbor и повторных запусков с pass@K. Бенчмарк команды @robofuture Кости Крестникова, который также выступал на конференции. 🔚 Выводы Для выбора модели нужен профиль ограничений: где теряется контекст, устаревает память или ломается выполнение инструкций. А если внедряем агента, измерять стоит всю систему — хороший балл отдельной LLM ещё не обещает надёжной работы её обвязки. 🔗 Более подробно — в презентации Алены (в комментариях файлом) и в записи выступления (тайминг: 6:29:30). 🔗 Тесты и лидерборды • LIBRA Mini • MERA Reason • MERA Text 2.0 • RUMBA • harness-bench-fast #benchmarks #evaluation #llm #agents #conference #paperwatch
    Post by “Сергей Марков: машинное обучение, искусство и шитпостинг” from September 29, 2026
  • 1.4K13 forwards19 reactions13 commentsOpen in Telegram
    🚀 Зарелизили WebPageBench: бенчмарк для оценки веб-агентов на повседневных задачах Год мы работали над этим проектом, и вот наконец представляем миру WebPageBench, бенчмарк для оценки веб-агентов в повседневных сценариях на русском языке (покупки в магазине, бронь билетов и отелей, заказ справок и так далее). Откуда ноги растут: гонять агентов по реальным сайтам неудобно, потому что интерфейсы меняются, антибот режет прогоны, а сценарии с корзиной и оплатой это настоящие заказы. Но главное, на живом сайте невозможно узнать, что агент реально сделал: остается верить ему на слово. В ответ на это мы и сделали WebPageBench, локальную среду из шести мок-сайтов, где каждое действие агента записывается в лог, по которому проверяется успех. 🚀 Что внутри: ✔️Шесть русскоязычных моков сайтов: маркетплейс, книги, доставка продуктов, ЖД-билеты, отели и файловый кабинет. Все обезличено, но повторяет популярные у нас сервисы, и поднимается локально. ✔️Проверка по логу событий, а не по словам агента. Каждое действие на странице пишется как типизированное событие с параметрами, а условие задачи это событие, которое должно появиться в логе. Никакой модели-судьи в цепочке нет, и проверка не зависит от языка интерфейса. ✔️152 задачи: 65 написанных руками сценариев и 87 их вариаций. ✔️Контролируемые варианты интерфейса. Одна и та же задача рендерится через разные реализации одного элемента (календарь всплывашкой против нативного input, счетчик гостей четырьмя способами). Текст задания и условия при этом не меняются, так что видно, агент не понял задачу или не справился с конкретным виджетом. ✔️Публичный лидерборд: 24 связки «модель + обвязка», прогнанные по всем задачам. 🚀 Что уже видно по результатам: ✔️Агенты систематически завышают свой успех. Одна связка отчиталась о выполнении всех задач до единой, а лог подтвердил 59%. Разрыв в 41 пункт! При этом бывает и наоборот: другая модель решила больше, чем сама о себе доложила. ✔️Лучшая обвязка зависит от модели, универсального рецепта нет. Та обвязка, что подняла одну модель, другую роняет на последнее место. ✔️Агенты по скриншотам заметно отстают от DOM-агентов. Особенно наглядно внутри одной модели: по DOM она решает 0,76, по скриншотам 0,48. ✔️Дорого не значит хорошо. Самый дорогой прогон в таблице ($76) дает результат хуже, чем прогон за $3. Если делаете веб-агента, присылайте свои результаты: подключить свою обвязку это один адаптер. 👉 Habr 👉 Код и задачи 👉 Лидерборд на HuggingFace 👉 Препринт @mashkka_ds #agents #benchmark #webagents
    Post by “Сергей Марков: машинное обучение, искусство и шитпостинг” from September 29, 2026
  • 1.5K14 forwards10 reactions7 commentsOpen in Telegram
    Наш препринт про архитектурную модификацию трансформера:
    huggingface.co/…https://huggingface.co/papers/2609.32814
    Change the Product, Keep the Parameters: Associative Algebra Layers for Transformers tl/dr Исследуем замену GEMM в MLP-слое трансформера на более лёгкую операцию, которая сохраняет билинейность и ассоциативность матричного умножения, но требует меньше вычислений при том же количестве обучаемых параметров. Лонгрид Работа состоит из трёх частей. Часть первая: математическая база Описывается новый оператор, заменяющий обычное матричное умножение. Формально доказывается, что он билинеен и ассоциативен. Для оператора над матрицами размера q×q вычисляется билинейный ранг — минимальное число скалярных умножений, необходимых для его вычисления. Для q=2 новый оператор имеет ранг 6. Для сравнения, обычное умножение 2×2 требует 8 умножений, а алгоритм Страссена — 7. Эти числа всплывут в третьей части 👇 Билинейность позволяет заменить линейную проекцию трансформера, не вводя дополнительную нелинейность, а также даёт возможность формально анализировать вычислительную стоимость оператора. При этом мы не уменьшаем число параметров и не используем sparsity или low-rank compression: сохраняется полный набор обучаемых весов, меняется только закон их умножения на активации. Часть вторая: синтетические экспы на GPU Показываем, что реализация нового оператора действительно может использоваться вместо GEMM в качестве линейной проекции трансформера. Приводятся оценки эффективности для нескольких архитектур, включая Qwen и DeepSeek. Часть третья: оценка end-to-end на декодерной LM Создаётся небольшая декодерная LM ёмкостью 110M параметров, близкая к GPT-2, но с небольшими модификациями (SwiGLU вместо стандартного FFN) и GPT-2-токенизатором. Делаем два варианта модели: с классическим GEMM и с новым оператором в MLP. Обе модели обучаются на одном и том же инструктивном датасете с бюджетом около 12.3B токенов и в одинаковом вычислительном окружении. Эксперимент показывает, что новый оператор остаётся обучаемым в реальных условиях, включая CUDA, floating-point вычисления и автоматическое дифференцирование в PyTorch. Затем измеряем скорость инференса и качество на downstream-задачах через lm-eval-harness. Для q=2 модель с новым оператором показывает прирост end-to-end throughput примерно на 7%. Для сравнения, переход от rank-7 алгоритма Страссена к rank-6 оператору сокращает число скалярных умножений примерно на 14.3%. Наблюдаемый выигрыш оказывается примерно вдвое меньше этого арифметического выигрыша, что ожидаемо: MLP составляет лишь часть вычислений модели, а итоговое время также определяется attention, LM head, memory traffic, sampling и другими операциями. Что дальше: много экспов с другими параметрами (q=3 и 4), настройка ядер и пр. 🤗 👉 hf dailypapers link 👈
  • 2K12 forwards43 reactions18 commentsOpen in Telegram
    Межславянский язык (вдруг вы про него не знали) share.google/8Htqivfw8FIlE0AQp
  • 2.1K88 forwards69 reactions68 commentsOpen in Telegram
    🎤 Выложил запись доклада "Сжатие приводит к истине? Как LLM выбирает, во что верить". Это рассказ про исследование, про которое уже писал, плюс все что накопал с тех пор И сразу мега крутая новость: вчера мою статью "Truth as a Compression Artifact in Language Model Training", на которой построен доклад, приняли в основной трек NeurIPS 2026! Моя первая серьезная научная статья - и сразу на одну из главных конференций по ИИ в мире!!!1 🎉🎉🎉 Насколько я смог найти, это вообще первый случай, когда в основной трек взяли работу независимого автора-одиночки из России Началось все с простого вопроса. Почему модели из разных стран одинаково не верят в астрологию, гомеопатию и в то, что на одной китайской площади ничего не произошло? В обучающих данных миллионы сайтов с гороскопами и весь китайский интернет. Чтобы разобраться, пришлось вступить на скользкую дорожку борца с мифами и лженаукой Главная мысль - обучение вымывает из данных непредсказуемость. Из научных данных можно последовательно делать предсказуемые выводы, поэтому наука хорошо сжимается. Астрология нет: по одной натальной карте разные астрологи выдают абсолютно разные прогнозы. Чтобы это проверить, обучил с нуля 300+ LLM-моделей разной архитектуры от 3.5M до 3B параметров. Никаких инициализаций открытыми весами, чистый рандом. Начал на своем маке, а закончил на кластере из восьми H100. Было дорого В докладе: - 1:14 - миф про 10% мозга (который так любят бизнес-коучи) - 3:20 - Кеплер и эпициклы - 4:47 - плоскоземельщик на ток-шоу - 6:34 - из лжи следует что угодно, или как Рассел доказал, что он Папа Римский - 11:12 - случайные ошибки модель вымывает, даже когда правильных ответов всего 10% - 12:33 - одно согласованное ложное правило - и предпочтение правды пропадает - 13:29 - с несколькими ложными правилами модель вдруг неожиданно начала предпочитать сложную ложь обычной математике. Потом рецензенты нашли ошибку в подсчетах - 15:05 - разбавил математику текстами из FineWeb так, что ее осталось 8% - 16:05 - случайно меняем географию в Википедии, так что в истории Франции появляется Уссурийск - 17:19 - что нашли рецензенты NeurIPS - 18:26 - главный вывод В посте про расцензуренный DeepSeek я писал, что алайнмент полностью снялся правкой 0,06% весов, а во что модель верит по-настоящему, решает претрейн. Когда китайская модель в чате уходит от ответа - это работа алайнмента, картина мира у нее может быть совсем другой. А вот для претрейна согласованная дезинформация неотличима от истины. Спасает то, что настоящие фейки редко бывают согласованными до конца Статья на arXiv | Код и данные на GitHub | Презентация из доклада P.S. Первое, что мне написали рецензенты: "парень, у тебя какая-то ерунда в данных". Они были правы - и теперь это статья на NeurIPS 😄 P.P.S. Число подписчиков моего канала уже почти 5000 человек (или агентов, тут уж не знаю). Мне очень приятно, спасибо 🙏
  • 2.6K11 forwards62 reactions14 commentsOpen in Telegram
    Нееееееет
    Post by “Сергей Марков: машинное обучение, искусство и шитпостинг” from September 26, 2026
  • 2.5K22 forwards54 reactions4 commentsOpen in Telegram
    Post by “Сергей Марков: машинное обучение, искусство и шитпостинг” from September 26, 2026

The channel in numbers

Created
March 11, 2022
Photos
3.7K
Videos
429
Files
24
Links
944

Telegram data as of October 2, 2026

Reviews

Leave a review
Rating

At least 40 characters. We publish it after a check.

Your review is public, and the channel owner cannot delete it.

No reviews yet. Yours would be the first.

Mentions

1 catalog channel mentions this channel.

Similar

More on this topic