@mashkka_ds
Mashkka про Data Science
Telegram-канал @mashkka_ds: 5,2 тыс. подписчиков, 1,2 тыс. просмотров на пост, оценка 54
54CВыше, чем у 4 из 10 каналов категории
Середина категории 46–63Этот канал 54
- 5,2 тыс.
- Подписчики
- 1,2 тыс.
- Медиана просмотров за 30 дней
- 23,4%
- Просмотры / подписчики за 30 дней
- 46
- Постов за 30 дней
Данные на 1 октября 2026 г.
О работе в data science и AI изнутри — от специалиста, который варится в этой сфере на практике, а не только в теории. Автор рассказывает про вебинары для ML-инженеров, разбирает инструменты вроде Pipeline для построения моделей, делится новостями об открытых релизах моделей от крупных лабораторий и зовёт подписчиков на профильные конференции. На 15 сентября: подписчиков 5,2 тыс., медиана просмотров 1,2 тыс., ER 24,2 % — на уровне медианы категории, хотя подписчиков заметно меньше медианы. При этом постов вышло больше, чем у типичного канала в категории. За последний месяц вышел пост о новой модели GigaChat 3.5 Reasoning с рассуждающими способностями, разбор вебинара OTUS про Pipeline в машинном обучении и новость о релизе линейки генеративных моделей Kandinsky WM 1.0 для Physical AI.
описание каталога О канале от автора
Погружение в Data Science и технологии GenAI
Частые вопросы
- Сколько подписчиков?
- Подписчиков — 5,2 тыс. Медиана просмотров поста — 1,2 тыс. Просмотров на подписчика — 23,4%. Данные на 1 октября 2026 г.
- Как часто выходят посты?
- За 30 дней вышло постов: 46 — это несколько раз в день. Данные на 1 октября 2026 г.
- Есть ли у канала галочка Telegram?
- Галочки Telegram нет.
- Кто ведёт страницу канала в каталоге?
- Пока никто. Если это ваш канал — заберите страницу: сможете отвечать на отзывы и видеть её статистику.
Это ваш канал?
Подтвердите владение — точные метрики и что улучшить, ответы на отзывы от лица канала и бейдж владельца на странице.
Подтвердить владениеЗаймёт минуту: пост с кодом или бот в администраторах
Ваша страница в tg.place
Знаете владельца?
Перешлите ему это сообщение — он подтвердит права и заберёт накопленное: статистику страницы и ответы на отзывы.
5 2055 059
1 окт.5 205
Наведите на график или проведите пальцем — покажем день.
| Из чего складывается | |
|---|---|
| Вовлечённость | 7 из 30 |
| Качество роста | 20 из 20 |
| Реакции и пересылки | 8,4 из 15 |
| Регулярность | 6,4 из 12 |
| Доверие | 3,8 из 8 |
| Отзывы | недостаточно данныхотзывов пока нет |
Оценка 54 — по 5 показателям из 6: остальные пока не измерены. Методология
Последние посты
- 🔥10 октября в Москве — конференция «ИИ: Наука в действии» Sber AI Lab и Университет ИТМО собирают исследователей, инженеров и лидеров индустрии, чтобы обсудить переход от передового AI-ресерча к реальным продуктам. 🔆В программе: 🔘11 докладов от топовых исследователей из Сбера, ИТМО, МФТИ, Сколтеха, AIRI и T-Bank. 🔘Панельная дискуссия «От науки к бизнес-внедрению» с участием профессоров и топ-менеджеров ведущих AI-центров. 🔘Международный keynote спикер. 🔆Ключевые темы: 🔘Фабрики LLM-агентов, управление знаниями и мультиагентные системы для автоматизации исследований и разработки. 🔘Эффективный инференс, сжатие MoE-моделей и оптимизация контекста в RAG-системах. 🔘Надежность и оценка LLM: детекция галлюцинаций, доверие к моделям и LLM-as-Judge. 🔘Обработка банковских данных и внедрение ИИ-решений. Зачем быть очно? ☑️Разобрать практический опыт внедрения ☑️Задать вопросы авторам исследований напрямую ☑️Нетворкинг с командами Sber AI Lab 📍Москва, Офис Сбера 📆10 октября, 11:00–18:00 ➡️Программа и регистрация по ссылке! ✈@sb_ai_lab
- 🎤 Дала Start в Research А сегодня провела первую лекцию на своем новом курсе Start в Research, где я учу студентов доводить свои исследования до научных публикаций уровня A/A*. Изначально курс задумывался как факультатив для онлайн-магистратура ИИ на ФКН, но по многочисленным просьбам перевели его в межфакультетский формат и открыли доступ для всех энтузиастов из ВШЭ. Для меня это новый курс, во многом экпериментальный и проба пера, и мне очень хочется дать в нем максимум от того багажа знаний, которые за много лет накопились у меня. Понимаю, что в области статей мне есть, чем поделиться и стараюсь помочь студентам избежать тех граблей, на которые наступала сама! @mashkka_ds #трудовыебудни #преподавание #вшэ #фкн #nlp #ai
Медиа
- 🔎 Модель говорит по-русски. А понимает? Пять новых линеек бенчмарков На AI RnD Day наша уважаемая Алёна Феногенова представила 5 линеек русскоязычных тестов для оценки современных моделей. 📌 TLDR Один общий балл в метрике плохо описывает модель для реального применения. Алена рассказала про 5 новых бенчмарков! 1️⃣ LIBRA проверяет работу с длинным контекстом, 2️⃣ MERA Reason — математические рассуждения, 3️⃣ MERA Text 2.0 — языковые, культурные и прикладные навыки, бенчмарки MERA разработаны совместно с Альянсом ИИ. 4️⃣ RUMBA оценивает память между сессиями, а 5️⃣ harness-bench-fast — работу в агентной обвязке: правильно выбрать тул в текстовой задаче и успешно выполнить действие в среде — не одно и то же. Результат зависит от всей связки — модель × обвязка × промпт × окружение. 📚 LIBRA Mini: поместилось в контекст ≠ прочитано Из 18 задач полной LIBRA выбрали шесть сложных и показательных. Диапазон — от 4K до 512K токенов, запуск через lm-evaluation-harness. Здесь мало найти одну фразу: нужно связать факты из разных частей текста, ответить по нескольким статьям Wikipedia, определить человека по теме диалога или посчитать уникальные абзацы среди повторов. Причем, у Qwen3-30B-A3B-Instruct-2507 итоговая оценка падает с 62,2 на 4K до 39,8 на 64K и 12,6 на 128K. Поэтому полезно смотреть не только на максимальное окно модели, но и на то, как меняется качество внутри него. 🧮 MERA Reason Линейка объединяет Luzitania — 251 олимпиадную задачу, TMath — 310 задач с акцентом на комбинаторику, теорию чисел и геометрию, ruAIME — 724 задачи с проверкой точного совпадения ответа. А также MMReD: 128 шагов среды, вход около 8,7K токенов и рассуждение около 20K. Проверяется работа с длинной последовательностью шагов. Все тесты публичные. ⚙️ MERA Text 2.0: где модели ещё различаются В новой версии 12 датасетов и около 8700 запросов — в 4,3 раза меньше прежнего объёма. Четыре группы: человеческая коммуникация, русскоязычный культурный контекст, базовые агентные навыки и рассуждение. Тесты приватные, результаты публикуются на лидерборде. Особенно полезен Agentic-раздел: соблюсти 3–6 формальных требований в одном запросе, преобразовать YAML/CSV/XML целиком, выбрать инструмент из каталога на 14–22 тула. Именно он лучше всего разделяет сильные модели и следующий эшелон. Но это ещё текстовая проверка навыков, не полноценный запуск агента. А понимание регионализмов, мемов и фольклора слабее связано с общим уровнем модели: высокий результат на других задачах его не гарантирует. 🧠 RUMBA: помнить нужно не всё подряд В наборе 85 диалогов и 1543 вопроса. Проверяется извлечение фактов, рассуждение по истории и умение признать отсутствие информации. Есть и временная составляющая: если пользователь сначала любил розы, потом кактусы, а теперь лилии, ответить «розы» — ошибка, хотя такой факт в истории был. Сравниваются два режима: весь диалог во входе и внешняя память/RAG. Простой RAG получает 68,89 по русскоязычной оценке LLM-судьи, memOS — 66,82, mem0 — 53,21. Сложнее — не обязательно лучше. Это сравнение показанных систем, не универсальный рейтинг подходов. 🛠 harness-bench-fast Около 391 кейса на файлы, CLI, инструменты, инструкции, память, программирование и отладку. Результат проверяет код, без LLM-судьи. Заявлен локальный прогон примерно за 30 минут без Docker и без интернета для тестовой среды; есть поддержка Harbor и повторных запусков с pass@K. Бенчмарк команды @robofuture Кости Крестникова, который также выступал на конференции. 🔚 Выводы Для выбора модели нужен профиль ограничений: где теряется контекст, устаревает память или ломается выполнение инструкций. А если внедряем агента, измерять стоит всю систему — хороший балл отдельной LLM ещё не обещает надёжной работы её обвязки. 🔗 Более подробно — в презентации Алены (в комментариях файлом) и в записи выступления (тайминг: 6:29:30). 🔗 Тесты и лидерборды • LIBRA Mini • MERA Reason • MERA Text 2.0 • RUMBA • harness-bench-fast #benchmarks #evaluation #llm #agents #conference #paperwatch
- 🚀 Зарелизили WebPageBench: бенчмарк для оценки веб-агентов на повседневных задачах Год мы работали над этим проектом, и вот наконец представляем миру WebPageBench, бенчмарк для оценки веб-агентов в повседневных сценариях на русском языке (покупки в магазине, бронь билетов и отелей, заказ справок и так далее). Откуда ноги растут: гонять агентов по реальным сайтам неудобно, потому что интерфейсы меняются, антибот режет прогоны, а сценарии с корзиной и оплатой это настоящие заказы. Но главное, на живом сайте невозможно узнать, что агент реально сделал: остается верить ему на слово. В ответ на это мы и сделали WebPageBench, локальную среду из шести мок-сайтов, где каждое действие агента записывается в лог, по которому проверяется успех. 🚀 Что внутри: ✔️Шесть русскоязычных моков сайтов: маркетплейс, книги, доставка продуктов, ЖД-билеты, отели и файловый кабинет. Все обезличено, но повторяет популярные у нас сервисы, и поднимается локально. ✔️Проверка по логу событий, а не по словам агента. Каждое действие на странице пишется как типизированное событие с параметрами, а условие задачи это событие, которое должно появиться в логе. Никакой модели-судьи в цепочке нет, и проверка не зависит от языка интерфейса. ✔️152 задачи: 65 написанных руками сценариев и 87 их вариаций. ✔️Контролируемые варианты интерфейса. Одна и та же задача рендерится через разные реализации одного элемента (календарь всплывашкой против нативного input, счетчик гостей четырьмя способами). Текст задания и условия при этом не меняются, так что видно, агент не понял задачу или не справился с конкретным виджетом. ✔️Публичный лидерборд: 24 связки «модель + обвязка», прогнанные по всем задачам. 🚀 Что уже видно по результатам: ✔️Агенты систематически завышают свой успех. Одна связка отчиталась о выполнении всех задач до единой, а лог подтвердил 59%. Разрыв в 41 пункт! При этом бывает и наоборот: другая модель решила больше, чем сама о себе доложила. ✔️Лучшая обвязка зависит от модели, универсального рецепта нет. Та обвязка, что подняла одну модель, другую роняет на последнее место. ✔️Агенты по скриншотам заметно отстают от DOM-агентов. Особенно наглядно внутри одной модели: по DOM она решает 0,76, по скриншотам 0,48. ✔️Дорого не значит хорошо. Самый дорогой прогон в таблице ($76) дает результат хуже, чем прогон за $3. Если делаете веб-агента, присылайте свои результаты: подключить свою обвязку это один адаптер. Спасибо всем, кто участвовал в этом большом совместном проекте, за ваш труд и результат! 👉 Habr 👉 Код и задачи 👉 Лидерборд на HuggingFace 👉 Препринт @mashkka_ds #agents #benchmark #webagents
- 🎤 Вышла на международный уровень вместе с магистратурой ИИ от ФКН ВШЭ Онлайн-магистратура ИИ выходит (а точнее даже возвращается) на международный уровень и вновь делает запуски для студентов со всего мира (спасибо @murr4a, что дравит эту вещь). Не могла пройти мимо этой инициативы и присоединилась к NLP-курсу, который в этом запуске читаем вместе с @greedisneutral и @awe_eu. Сегодня провела свою первую лекцию на курсе. На занятии были студенты со всего глобуса: Мексика, Бразилия, Индия. Читать на такую широкую аудиторию это отдельный вызов и отдельное удовольствие: возможность поделиться знаниями с ребятами со всего мира. А еще отдельный выброс эндорфинов это лекции на английском, по практике которого я сейчас так скучаю. @mashkka_ds #трудовыебудни #преподавание #вшэ #фкн #nlp #ai
- 🇦🇲 #justaboutme онажды в Армении ⠀ Засиделась в Москве, а осень навевает хандру. Махнула за летом в солнечную Армению. Вспоминаю в честь этого факты про озеро Севан: ✔️Это самое большое озеро не только в Армении, но и всего Кавказа. ✔️Лежит на высоте 1900 метров, выше, чем большинство горнолыжных курортов. ✔️Занимает почти 5% всей территории страны. ✔️В него впадает 28 рек, а вытекает всего одна, Раздан. ✔️Максимальная глубина 83 метра. ✔️Название, скорее всего, пришло от урартского «суниа», что значит просто «озеро». ✔️Монастырь Севанаванк построили в 874 году, и стоял он на острове, который сегодня превратился в полуостров. ✔️К середине 1990-х уровень воды в озере упал примерно на 19 метров, и остров с монастырем прирос к берегу. ✔️Здесь водится ишхан, севанская форель, которой нет больше нигде в мире. ❕#justaboutme воскресная рубрика, в которой я делюсь яркими событиями из своей жизни, не связанными с DS и ИТ, подобно тому, как я это делаю в соцсетях (например, в инсте или VK). ⠀ #ереван #mashkka_armenia #armenia #justaboutme
- #пятничныемемасы
- 👣По следам вебинара Дерево решений - простой и интерпретируемый ML-алгоритм Делюсь записью открытого урока про деревья решений, простой и популярный алгоритм, который широко используется в классическом ML. 🫥Запись 💭Слайды 🤖Практика ➕BONUS: открытый урок по ансамблям #ml #открытыйурок
- 🐾По следам вебинара Ландшафт современного NLP: от эмбеддингов до современных LLM На открытом вебинаре в Otus провела обзор методов современного NLP: от классических текстовых эмбеддингов до передовых методов для работы с LLM таких как RAG и LORA. Обсудили концепции и, как понять, что выбрать именно вам для ваших задач. @mashkka_ds 👀Запись 🌐Слайды 📚Шпаргалка RAG vs LORA @mashkka_ds #llm #ai
О канале в цифрах
- Создан
- 19 октября 2022 г.
- Фото
- 3 тыс.
- Видео
- 295
- Файлы
- 5
- Ссылки
- 1,3 тыс.
По данным Telegram на 1 октября 2026 г.
Рейтинги и подборки
Отзывы
Оставить отзыв
Отзывов пока нет. Ваш будет первым.