@oulenspiegel_channel
Сергей Марков: машинное обучение, искусство и шитпостинг
Telegram-канал @oulenspiegel_channel: 11,1 тыс. подписчиков, 3 тыс. просмотров на пост, оценка 49
49DВыше, чем у 3 из 10 каналов категории
Середина категории 46–63Этот канал 49
- 11,1 тыс.
- Подписчики
- 3 тыс.
- Медиана просмотров за 30 дней
- 27,1%
- Просмотры / подписчики за 30 дней
- 47
- Постов за 30 дней
Данные на 1 октября 2026 г.
Про машинное обучение, исследования языковых моделей и научный юмор пополам с шитпостингом от исследователя в области ИИ. Автор рассказывает про бенчмарки, архитектуры трансформеров и работу с большими языковыми моделями, перемежая это личными наблюдениями и шутками. На 30 сентября: 11,1 тыс. подписчиков, медиана просмотров поста 2,3 тыс., ER 21,1 % — ниже медианы категории, где этот показатель держится на уровне 24,1 %. Постов заметно больше, чем обычно выходит у соседей по категории. Среди последних материалов — разбор бенчмарка WebPageBench для оценки веб-агентов, препринт об архитектурной модификации трансформера с заменой GEMM-операции в MLP-слое, выступление Алёны Феногеновой с пятью линейками русскоязычных тестов для языковых моделей и доклад про сжатие и истину в обучении LLM. Также упоминалась офлайн-конференция на Кутузовском проспекте.
описание каталога О канале от автора
Машинное обучение, искусственный интеллект, искусство, мемасы, всякое личное и странноэ
Частые вопросы
- Сколько подписчиков?
- Подписчиков — 11,1 тыс. Медиана просмотров поста — 3 тыс. Просмотров на подписчика — 27,1%. Данные на 1 октября 2026 г.
- Как часто выходят посты?
- За 30 дней вышло постов: 47 — это несколько раз в день. Данные на 1 октября 2026 г.
- Есть ли у канала галочка Telegram?
- Галочки Telegram нет.
- Кто ведёт страницу канала в каталоге?
- Пока никто. Если это ваш канал — заберите страницу: сможете отвечать на отзывы и видеть её статистику.
Это ваш канал?
Подтвердите владение — точные метрики и что улучшить, ответы на отзывы от лица канала и бейдж владельца на странице.
Подтвердить владениеЗаймёт минуту: пост с кодом или бот в администраторах
Ваша страница в tg.place
Знаете владельца?
Перешлите ему это сообщение — он подтвердит права и заберёт накопленное: статистику страницы и ответы на отзывы.
11 10611 063
1 окт.11 085−1 за день
Наведите на график или проведите пальцем — покажем день.
| Из чего складывается | |
|---|---|
| Вовлечённость | 11,3 из 30 |
| Качество роста | 9,6 из 20 |
| Реакции и пересылки | 10,5 из 15 |
| Регулярность | 6,6 из 12 |
| Доверие | 3,9 из 8 |
| Отзывы | недостаточно данныхотзывов пока нет |
Оценка 49 — по 5 показателям из 6: остальные пока не измерены. Методология
Последние посты
- 🧠 Долгосрочная омнимодальная память Нужный факт может остаться в старом диалоге, быть на фотографии или в прошедшем видео-звонке. Как его вспомнить? Просто складывать всё в один промпт — не хватит контекста. На AI RnD Day наш сотрудник Андрей Безбородов рассказал, как команда сравнивала подходы к памяти для разных доменов и модальностей — диалогов, видео и робототехники. 📌 TLDR В докладе память моделируется через две операции: ingest — принять и сохранить информацию, search — найти эту информацию по запросу. Большое контекстное окно LLM само по себе такой системы не даёт, но служит стартовой отправной точкой. В диалоговых тестах обычный RAG оказался достаточно успешным и сильным решением, причем более сложные схемы не всегда выигрывали. Для других модальностей, типа видео, критично сохранять визуальную информацию, а не только текстовое саммари, иначе теряется смысл, который зачастую нельзя сохранить простым кепшенингом кадров. ⚙️ RAG Длинный контекст разбивают на фрагменты, строят для них векторные представления и по вопросу извлекают подходящие куски. Модель получает не всю информацию, а только таргетные знания. У RAG тоже есть слабые места: сведения могут оказаться на границе фрагментов, а похожий по смыслу факт — быть устаревшим. Найти, что пользователь когда-то любил, и понять, что он любит сейчас, — разные задачи. Результаты: SimpleRAG: На LongMemEval с Qwen3-VL-8B оценка выросла с 41,2% до 50,8%. Подход MemOS дал 53,2%: он хранит память в структуре MemCube, разделяя графовые связи и векторные данные между двумя базами. Однако такую систему сложнее развернуть! Схема SGR + File Tools с циклом "рассуждение → действие → наблюдение" получила 32,2% — ниже обоих вариантов. То есть наличие агента с инструментами ещё не делает память лучше. 🗜 Почему не сжать найденный текст в вектор? В xRAG вместо текста документа в модель передают его вектор через обучаемый проектор. В итоге открытая xRAG-7B незначительно обошла RAG на бенче TriviaQA: 58,9% против 56,1%. На внутреннем бенчмарке команды результат составил уже 8,8% против 50,2% у RAG. Успех на одном домене не перенёсся на другой. 🎬 Видео нельзя без потерь превратить в пересказ WorldMM строит 3 вида памяти: эпизодическую — о конкретных событиях, семантическую — обобщённые факты и связи, визуальную — представления видеофрагментов. Видео режется на клипы по 30c. Qwen-VL описывает кадры, Whisper распознаёт речь. Из описаний формируются тройки вида "объект — отношение — объект", а визуальные представления строит VLM2Vec. Со всеми типами памяти WorldMM оставался примерно на уровне подачи полного контекста. При отключении визуальной памяти оценка падала с 50% до 41%. Важно отметить, что текстовое описание не сохраняет каждую деталь кадра, и это проблема. Нужные редкие детали или события из кадров уже не из чего восстановить. 🤖 А если это память робота? M3 Agent объединяет распознавание лиц, транскрибацию и записи эпизодов на базе Qwen-Omni. На бенчмарке M3-Bench-Robots оценка выросла с 18% до 33% у M3 Agent. Но обработка видео занимала примерно столько же времени, сколько оно длится, а формирование ответа — около 30 секунд. Это очень долго и для роботов может быть неприемлимо. 🔚 Выводы Память стоит выбирать под тип информации и вопросы к ней: поиск по переписке, понимание видео и воспоминания робота требуют разных решений. Начать полезно с простого RAG и сравнения с полным контекстом. Затем можно усложнять систему, когда понятен выигрыш в качестве и его цена по времени. 🔗 Более подробно — в презентации Андрея (в комментариях файлом) и в записи выступления (тайминг: 3:04:55). #memory #RAG #agents #conference #paperwatch
- 🧩 От слов к виджетам Сегодня UI обычно подстраивается под задачу: отдельный экран для покупки, карты, настройки или аналитика. Но с генеративными моделями появляется другой сценарий — интерфейс сам собирается под человека и конкретную задачу, в зависимости от рекомендаций и предпочтений пользователя. На AI RnD Day Ира Пионтковская рассказала, как может выглядеть такой подход и какие технические проблемы возникают на практике. 📌 TLDR LLM пишет код, браузер превращает его в интерфейс. Но кто проверит, что кнопки работают, график не врёт, а виджет отвечает на исходный запрос? Generative UI — это не просто "LLM рисует HTML". Модель должна сгенерировать работающий интерфейс, пользователь — взаимодействовать с ним, а система — понять, действительно ли UI решает задачу с приемлемым качеством. 💥 Красиво ≠ правильно У интерфейса как минимум три слоя проверки: внешний вид, поведение и смысл. Текст может читаться, кнопки — нажиматься, а задача всё равно останется нерешённой. Например, график расходов аккуратно сортирует дни недели по алфавиту. Визуально всё хорошо, а хронология потеряна. 🎙 Почему UI становится частью диалога В классическом интерфейсе пользователь говорит: "покажи шкафы глубиной до 40 см", а приложение показывает экран с результатами. В GenUI модель может создать сам интерфейс под текущую задачу: показать варианты, дать выбрать один, открыть план комнаты и позволить перетащить шкаф. Получается, что виджет становится частью реплики модели — примерно как жест или указание в разговоре. Это особенно интересно вместе с full-duplex voice: пользователь может сказать «этот сюда», модель — показать объект и место на экране, а пользователь — сразу изменить его положение. 🧠 Главная проблема — как проверить UI Сгенерированный HTML может выглядеть красиво, но при этом содержать смысловую или функциональную ошибку. Поэтому мы исследуем VLM-as-a-judge, которая получает запрос, код и скриншоты двух виджетов и должна определить, какой лучше решает задачу. На примере бенчмарка дефектов: берём корректный график и намеренно добавляем один дефект — обрезанный текст, наложение элементов, пропавший объект, подпись не по теме или противоречие с данными. Основной разброс появляется на задачах, где нужно обнаружить ошибку, а не просто прочитать изображение. Например, на обнаружении обрезанного текста Gemini 2.5 Pro дал 100% правильных ответов, GPT-5 — 92%, а Grok 4.20 — 31%. 🛠 Можно ли обучить самого судью? Да. Мы собрали пары из хороших и намеренно испорченных виджетов: перекрытия, блюр, зависания, подмена темы и другие дефекты. Затем дообучили Qwen3.6-35B-A3B. На тесте после DPO точность на повреждённых виджетах выросла с 66% до 100%, а среднее время ответа сократилось примерно с 820 до 25 секунд. 🤖 Следующий уровень — GUI-агент Визуальной проверки недостаточно. Интерфейс может выглядеть правильно, но кнопка не работать. Поэтому следующий шаг — дать GUI-агенту реальный сценарий: "Добавь дубовый шкаф в список покупок". Агент сам кликает по интерфейсу, выбирает нужный объект и проверяет состояние приложения. Если ожидаемый результат не достигнут, траекторию действий и ошибку можно вернуть генератору для исправления. Так появляется полноценный цикл: LLM генерирует UI → GUI-агент взаимодействует → проверяется состояние → ошибка возвращается генератору. 🔚 Выводы Generative UI — это следующий шаг после обычного chatbot-интерфейса: модель может не только отвечать, но и собирать форму взаимодействия под конкретную задачу. Но чтобы это работало в проде, одного сильного генератора недостаточно. Нужны проверяемые среды, модели-судьи и агенты, способные взаимодействовать с интерфейсом. В конечном счёте хочется прийти к системе, где каждой задаче — свой интерфейс, а его качество проверяется автоматически. А после доклада был задан очень хороший вопрос о недалеком будущем: "Будем ли мы жить в одном едином окне, в котором отражена вся наша жизнь?". Кажется, что все к этому идет! 🔗 Более подробно — в презентации Ирины (оставим в комментариях файлом) и в записи выступления (тайминг: 5:04:40). #genui #paperwatch #conference
- UPD: конференция пройдёт по адресу Кутузовский проспект, 32 корпус 1
- 🔎 Модель говорит по-русски. А понимает? Пять новых линеек бенчмарков На AI RnD Day наша уважаемая Алёна Феногенова представила 5 линеек русскоязычных тестов для оценки современных моделей. 📌 TLDR Один общий балл в метрике плохо описывает модель для реального применения. Алена рассказала про 5 новых бенчмарков! 1️⃣ LIBRA проверяет работу с длинным контекстом, 2️⃣ MERA Reason — математические рассуждения, 3️⃣ MERA Text 2.0 — языковые, культурные и прикладные навыки, бенчмарки MERA разработаны совместно с Альянсом ИИ. 4️⃣ RUMBA оценивает память между сессиями, а 5️⃣ harness-bench-fast — работу в агентной обвязке: правильно выбрать тул в текстовой задаче и успешно выполнить действие в среде — не одно и то же. Результат зависит от всей связки — модель × обвязка × промпт × окружение. 📚 LIBRA Mini: поместилось в контекст ≠ прочитано Из 18 задач полной LIBRA выбрали шесть сложных и показательных. Диапазон — от 4K до 512K токенов, запуск через lm-evaluation-harness. Здесь мало найти одну фразу: нужно связать факты из разных частей текста, ответить по нескольким статьям Wikipedia, определить человека по теме диалога или посчитать уникальные абзацы среди повторов. Причем, у Qwen3-30B-A3B-Instruct-2507 итоговая оценка падает с 62,2 на 4K до 39,8 на 64K и 12,6 на 128K. Поэтому полезно смотреть не только на максимальное окно модели, но и на то, как меняется качество внутри него. 🧮 MERA Reason Линейка объединяет Luzitania — 251 олимпиадную задачу, TMath — 310 задач с акцентом на комбинаторику, теорию чисел и геометрию, ruAIME — 724 задачи с проверкой точного совпадения ответа. А также MMReD: 128 шагов среды, вход около 8,7K токенов и рассуждение около 20K. Проверяется работа с длинной последовательностью шагов. Все тесты публичные. ⚙️ MERA Text 2.0: где модели ещё различаются В новой версии 12 датасетов и около 8700 запросов — в 4,3 раза меньше прежнего объёма. Четыре группы: человеческая коммуникация, русскоязычный культурный контекст, базовые агентные навыки и рассуждение. Тесты приватные, результаты публикуются на лидерборде. Особенно полезен Agentic-раздел: соблюсти 3–6 формальных требований в одном запросе, преобразовать YAML/CSV/XML целиком, выбрать инструмент из каталога на 14–22 тула. Именно он лучше всего разделяет сильные модели и следующий эшелон. Но это ещё текстовая проверка навыков, не полноценный запуск агента. А понимание регионализмов, мемов и фольклора слабее связано с общим уровнем модели: высокий результат на других задачах его не гарантирует. 🧠 RUMBA: помнить нужно не всё подряд В наборе 85 диалогов и 1543 вопроса. Проверяется извлечение фактов, рассуждение по истории и умение признать отсутствие информации. Есть и временная составляющая: если пользователь сначала любил розы, потом кактусы, а теперь лилии, ответить «розы» — ошибка, хотя такой факт в истории был. Сравниваются два режима: весь диалог во входе и внешняя память/RAG. Простой RAG получает 68,89 по русскоязычной оценке LLM-судьи, memOS — 66,82, mem0 — 53,21. Сложнее — не обязательно лучше. Это сравнение показанных систем, не универсальный рейтинг подходов. 🛠 harness-bench-fast Около 391 кейса на файлы, CLI, инструменты, инструкции, память, программирование и отладку. Результат проверяет код, без LLM-судьи. Заявлен локальный прогон примерно за 30 минут без Docker и без интернета для тестовой среды; есть поддержка Harbor и повторных запусков с pass@K. Бенчмарк команды @robofuture Кости Крестникова, который также выступал на конференции. 🔚 Выводы Для выбора модели нужен профиль ограничений: где теряется контекст, устаревает память или ломается выполнение инструкций. А если внедряем агента, измерять стоит всю систему — хороший балл отдельной LLM ещё не обещает надёжной работы её обвязки. 🔗 Более подробно — в презентации Алены (в комментариях файлом) и в записи выступления (тайминг: 6:29:30). 🔗 Тесты и лидерборды • LIBRA Mini • MERA Reason • MERA Text 2.0 • RUMBA • harness-bench-fast #benchmarks #evaluation #llm #agents #conference #paperwatch
- 🚀 Зарелизили WebPageBench: бенчмарк для оценки веб-агентов на повседневных задачах Год мы работали над этим проектом, и вот наконец представляем миру WebPageBench, бенчмарк для оценки веб-агентов в повседневных сценариях на русском языке (покупки в магазине, бронь билетов и отелей, заказ справок и так далее). Откуда ноги растут: гонять агентов по реальным сайтам неудобно, потому что интерфейсы меняются, антибот режет прогоны, а сценарии с корзиной и оплатой это настоящие заказы. Но главное, на живом сайте невозможно узнать, что агент реально сделал: остается верить ему на слово. В ответ на это мы и сделали WebPageBench, локальную среду из шести мок-сайтов, где каждое действие агента записывается в лог, по которому проверяется успех. 🚀 Что внутри: ✔️Шесть русскоязычных моков сайтов: маркетплейс, книги, доставка продуктов, ЖД-билеты, отели и файловый кабинет. Все обезличено, но повторяет популярные у нас сервисы, и поднимается локально. ✔️Проверка по логу событий, а не по словам агента. Каждое действие на странице пишется как типизированное событие с параметрами, а условие задачи это событие, которое должно появиться в логе. Никакой модели-судьи в цепочке нет, и проверка не зависит от языка интерфейса. ✔️152 задачи: 65 написанных руками сценариев и 87 их вариаций. ✔️Контролируемые варианты интерфейса. Одна и та же задача рендерится через разные реализации одного элемента (календарь всплывашкой против нативного input, счетчик гостей четырьмя способами). Текст задания и условия при этом не меняются, так что видно, агент не понял задачу или не справился с конкретным виджетом. ✔️Публичный лидерборд: 24 связки «модель + обвязка», прогнанные по всем задачам. 🚀 Что уже видно по результатам: ✔️Агенты систематически завышают свой успех. Одна связка отчиталась о выполнении всех задач до единой, а лог подтвердил 59%. Разрыв в 41 пункт! При этом бывает и наоборот: другая модель решила больше, чем сама о себе доложила. ✔️Лучшая обвязка зависит от модели, универсального рецепта нет. Та обвязка, что подняла одну модель, другую роняет на последнее место. ✔️Агенты по скриншотам заметно отстают от DOM-агентов. Особенно наглядно внутри одной модели: по DOM она решает 0,76, по скриншотам 0,48. ✔️Дорого не значит хорошо. Самый дорогой прогон в таблице ($76) дает результат хуже, чем прогон за $3. Если делаете веб-агента, присылайте свои результаты: подключить свою обвязку это один адаптер. 👉 Habr 👉 Код и задачи 👉 Лидерборд на HuggingFace 👉 Препринт @mashkka_ds #agents #benchmark #webagents
- Наш препринт про архитектурную модификацию трансформера:Change the Product, Keep the Parameters: Associative Algebra Layers for Transformers tl/dr Исследуем замену GEMM в MLP-слое трансформера на более лёгкую операцию, которая сохраняет билинейность и ассоциативность матричного умножения, но требует меньше вычислений при том же количестве обучаемых параметров. Лонгрид Работа состоит из трёх частей. Часть первая: математическая база Описывается новый оператор, заменяющий обычное матричное умножение. Формально доказывается, что он билинеен и ассоциативен. Для оператора над матрицами размера q×q вычисляется билинейный ранг — минимальное число скалярных умножений, необходимых для его вычисления. Для q=2 новый оператор имеет ранг 6. Для сравнения, обычное умножение 2×2 требует 8 умножений, а алгоритм Страссена — 7. Эти числа всплывут в третьей части 👇 Билинейность позволяет заменить линейную проекцию трансформера, не вводя дополнительную нелинейность, а также даёт возможность формально анализировать вычислительную стоимость оператора. При этом мы не уменьшаем число параметров и не используем sparsity или low-rank compression: сохраняется полный набор обучаемых весов, меняется только закон их умножения на активации. Часть вторая: синтетические экспы на GPU Показываем, что реализация нового оператора действительно может использоваться вместо GEMM в качестве линейной проекции трансформера. Приводятся оценки эффективности для нескольких архитектур, включая Qwen и DeepSeek. Часть третья: оценка end-to-end на декодерной LM Создаётся небольшая декодерная LM ёмкостью 110M параметров, близкая к GPT-2, но с небольшими модификациями (SwiGLU вместо стандартного FFN) и GPT-2-токенизатором. Делаем два варианта модели: с классическим GEMM и с новым оператором в MLP. Обе модели обучаются на одном и том же инструктивном датасете с бюджетом около 12.3B токенов и в одинаковом вычислительном окружении. Эксперимент показывает, что новый оператор остаётся обучаемым в реальных условиях, включая CUDA, floating-point вычисления и автоматическое дифференцирование в PyTorch. Затем измеряем скорость инференса и качество на downstream-задачах через lm-eval-harness. Для q=2 модель с новым оператором показывает прирост end-to-end throughput примерно на 7%. Для сравнения, переход от rank-7 алгоритма Страссена к rank-6 оператору сокращает число скалярных умножений примерно на 14.3%. Наблюдаемый выигрыш оказывается примерно вдвое меньше этого арифметического выигрыша, что ожидаемо: MLP составляет лишь часть вычислений модели, а итоговое время также определяется attention, LM head, memory traffic, sampling и другими операциями. Что дальше: много экспов с другими параметрами (q=3 и 4), настройка ядер и пр. 🤗 👉 hf dailypapers link 👈
huggingface.co/…
https://huggingface.co/papers/2609.32814 - Межславянский язык (вдруг вы про него не знали) share.google/8Htqivfw8FIlE0AQp
- 🎤 Выложил запись доклада "Сжатие приводит к истине? Как LLM выбирает, во что верить". Это рассказ про исследование, про которое уже писал, плюс все что накопал с тех пор И сразу мега крутая новость: вчера мою статью "Truth as a Compression Artifact in Language Model Training", на которой построен доклад, приняли в основной трек NeurIPS 2026! Моя первая серьезная научная статья - и сразу на одну из главных конференций по ИИ в мире!!!1 🎉🎉🎉 Насколько я смог найти, это вообще первый случай, когда в основной трек взяли работу независимого автора-одиночки из России Началось все с простого вопроса. Почему модели из разных стран одинаково не верят в астрологию, гомеопатию и в то, что на одной китайской площади ничего не произошло? В обучающих данных миллионы сайтов с гороскопами и весь китайский интернет. Чтобы разобраться, пришлось вступить на скользкую дорожку борца с мифами и лженаукой Главная мысль - обучение вымывает из данных непредсказуемость. Из научных данных можно последовательно делать предсказуемые выводы, поэтому наука хорошо сжимается. Астрология нет: по одной натальной карте разные астрологи выдают абсолютно разные прогнозы. Чтобы это проверить, обучил с нуля 300+ LLM-моделей разной архитектуры от 3.5M до 3B параметров. Никаких инициализаций открытыми весами, чистый рандом. Начал на своем маке, а закончил на кластере из восьми H100. Было дорого В докладе: - 1:14 - миф про 10% мозга (который так любят бизнес-коучи) - 3:20 - Кеплер и эпициклы - 4:47 - плоскоземельщик на ток-шоу - 6:34 - из лжи следует что угодно, или как Рассел доказал, что он Папа Римский - 11:12 - случайные ошибки модель вымывает, даже когда правильных ответов всего 10% - 12:33 - одно согласованное ложное правило - и предпочтение правды пропадает - 13:29 - с несколькими ложными правилами модель вдруг неожиданно начала предпочитать сложную ложь обычной математике. Потом рецензенты нашли ошибку в подсчетах - 15:05 - разбавил математику текстами из FineWeb так, что ее осталось 8% - 16:05 - случайно меняем географию в Википедии, так что в истории Франции появляется Уссурийск - 17:19 - что нашли рецензенты NeurIPS - 18:26 - главный вывод В посте про расцензуренный DeepSeek я писал, что алайнмент полностью снялся правкой 0,06% весов, а во что модель верит по-настоящему, решает претрейн. Когда китайская модель в чате уходит от ответа - это работа алайнмента, картина мира у нее может быть совсем другой. А вот для претрейна согласованная дезинформация неотличима от истины. Спасает то, что настоящие фейки редко бывают согласованными до конца Статья на arXiv | Код и данные на GitHub | Презентация из доклада P.S. Первое, что мне написали рецензенты: "парень, у тебя какая-то ерунда в данных". Они были правы - и теперь это статья на NeurIPS 😄 P.P.S. Число подписчиков моего канала уже почти 5000 человек (или агентов, тут уж не знаю). Мне очень приятно, спасибо 🙏
- Нееееееет
О канале в цифрах
- Создан
- 11 марта 2022 г.
- Фото
- 3,7 тыс.
- Видео
- 429
- Файлы
- 24
- Ссылки
- 944
По данным Telegram на 1 октября 2026 г.
Отзывы
Оставить отзыв
Отзывов пока нет. Ваш будет первым.
Упоминания
Этот канал упоминает 1 канал каталога.