Канал про нейронные сети и новейшие методы в машинном обучении Website: neurohive.io/ru/
5 010подписчиков сейчас
45.0%ERR
6.0цитируемость
6постов/день
Русскийязык
Россиягео
Подписаться в Telegram
Данные обновлены 22.07.2020
Публикации всего: 45
4DAnyone: 4D-модель человека из видео, снятого одной камерой
Исследователи из Zhejiang University, Robbyant, Ant Group и HKUST представили 4DAnyone - открытый фреймворк, который строит 4D-модель человека на основе видео, снятого с одной камеры. 4DAnyone генерирует 16 согласованных между собой ракурсов, а по ним уже собирается объёмная сцена в формате 4D Gaussian Splatting. Раньше для такого требовалась студия с десятками синхронных камер. Готовую модель человека можно смотреть с любой точки в VR-шлеме, вставлять в игру или AR-сцену, использовать как данные для обучения роботов движению. Наилучшие результаты достигаются при одном человеке в кадре, спокойном движении камеры и облегающей одежде.
3D-модель - это объект, который можно осмотреть со всех сторон, но застывший в одной позе. 4D-модель добавляет четвёртую ось - время. Cцена меняется от кадра к кадру, объект двигается, и при этом на каждый момент времени существует его полное объёмное представление.
В основе фреймворка лежит видеодиффузионный трансформер Wan2.2-TI2V-5B, который дообучили генерировать новые ракурсы человека по 3D-скелету, сохраняя внешность из исходного видео. В скелете оставили 40 ключевых точек: 17 на теле, 6 на стопах, 10 на уровне ладоней и 7 вспомогательных. Детальную разметку лица и суставов пальцев отбросили: такие точки определяются неточно, и метод, следуя за ошибочным положением, выдаёт артефакты. Мимику и форму кистей он вместо этого берёт из исходного видео.
По качеству реконструкции 4DAnyone обходит все сравниваемые методы: 24.15 PSNR против 20.55 у ближайшего конкурента на DNA-Rendering и 23.28 против 19.86 на DyMVHumans.
Проект открытый: код опубликован на GitHub, веса - на Hugging Face.
#Stateoftheart
🔥 9 ❤ 5 👍 4
Перейти к публикации →
JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одной B200
Команда Joy Future Academy представила JoyAI-Video-Edit — открытую авторегрессионную диффузионную модель на 16B параметров для редактирования видео в реальном времени. Модель обрабатывает кадры по текстовому промпту по мере их поступления, без доступа к будущим кадрам и не зная длину ролика. Полный сквозной пайплайн выдаёт 30.19 FPS в разрешении 720×1280 на одной Nvidia B200.
JoyAI-Video-Edit умеет менять фон, стиль (акварель, масло, мультфильм), добавлять, удалять и заменять объекты и людей в кадре, менять одежду и внешность, изменять движения персонажей и объектов. Отдельно поддерживается редактирование по референсной картинке, когда одежда или предмет с фотографии переносится на человека в видео. Всё это работает поверх исходного ролика, оставляя без изменений движения, композицию и те области видеопотока, которые менять не просили.
Архитектура модели состоит из энкодера условий на базе MLLM, каузального видео-VAE и мультимодального диффузионного трансформера. Итеративный денойзинг сжат до двух шагов методом Source-Anchored DMD, который привязывает учителя к синхронному фрагменту исходного видео и не даёт картинке отходить от оригинала на длинных потоках.
Результаты: на бенчмарке OpenVE-Bench модель набирает 3.60 балла против 2.62 у SANA-Streaming и 1.87 у XMax-X2.0, что сопоставимо по качеству с офлайн-редакторами Kling-3.0 Omni (3.64) и Bernini-R (3.72). На минутных видео из LongV2VBench — 3.30 против 1.71 у ближайшего конкурента. В попарной человеческой оценке JoyAI-Video-Edit выигрывает у потоковых редакторов в 81–90% случаев.
Код инференса выложен на GitHub, веса - на Hugging Face под лицензией Apache 2.0.
#Stateoftheart
🔥 11 👍 2 ❤ 1 · всего 15
Перейти к публикации →
TurboVLA: робот получает команды в разы быстрее при 97% успешных выполнений благодаря замене LLM на BERT
Исследователи из Хуачжунского университета науки и технологий и Huawei опубликовали TurboVLA - компактную vision-language-action модель, которая выдаёт действия для робота за 31.2 мс на RTX 4090 и набирает 97.7% на бенчмарке для роботов LIBERO. Главное отличие от других VLA в том, что внутри нет LLM. Вместо неё лёгкий текстовый энкодер BERT, а картинка и инструкция обмениваются информацией напрямую через модуль кросс-внимания. Отсюда 0.2B параметров вместо миллиардов и меньше 1 ГБ видеопамяти на инференсе.
Обычно VLA-модели устроены так: робот получает картинку с камеры и текстовую инструкцию по типу «сложи три миски друг на друга». Визуальные признаки сначала проецируются в пространство токенов языковой модели, склеиваются с токенами инструкции, прогоняются через модель, и уже из её скрытых состояний декодируются действия. Этот путь обозначается как V → L → A: сначала зрение, затем язык, потом действие. Ключевое наблюдение исследователей простое: если в инструкции уже написано, что делать, то от текста нужно только подсказать, на какие визуальные детали смотреть. Вместо V → L → A авторы предлагают прямое отображение V + L → A. Картинки и инструкция кодируются независимо, потом обмениваются информацией напрямую, минуя большую языковую модель. За один прямой проход модель выдаёт сразу чанк из 12 шагов управления.
Результаты на бенчмарке для роботов LIBERO: TurboVLA набирает 97.7% в среднем при 0.2B параметров, 0.9 ГБ видеопамяти и 31.2 мс задержки. Для сравнения, модель π0.5 выдаёт 96.9% при 3.4B параметров, 12.8 ГБ и 93.6 мс. VLA-JEPA набирает 97.2% при 2.8B и 108.7 мс, CogVLA 97.4% при 8.3B и 115.5 мс. Среди лёгких моделей Evo-1 даёт 94.8% при 0.8B, VLA-Adapter 97.3% при 1.5B. На реальном роботе AgileX Piper модель проверили на четырёх задачах (взять валик, отодвинуть карту, нажать степлер, сложить три миски) и получила от 80% до 92.5% success rate, в каждой из них обойдя π0.5.
Симуляционную часть можно воспроизвести целиком: обучение и тесты шли на открытых датасетах LIBERO и RoboTwin 2.0 (для версии под RoboTwin брали визуальный энкодер побольше, там 0.4B параметров). Собственные данные использовали только для дообучения под реального робота. TurboVLA рассчитана на конкретные инструкции. Если попросить робота «приготовить завтрак», разбивать это на шаги будет нечем.
Код модели доступен на GitHub под лицензией Apache-2.0, веса выложены на Hugging Face.
#Stateoftheart
❤ 4 👍 4 🔥 3 · всего 15
Перейти к публикации →
🗜Bonsai: 1-bit версия Qwen 27B работает на iPhone c сохранением 90% качества ответов
Стартап PrismML выпустил Bonsai 27B — бинарную и тернарную версии Qwen3.6-27B, которые сохраняют 90–95% качества исходной модели при сжатии весов в 9.4–14.2 раза. Тернарная версия занимает 5.9 ГБ и работает на ноутбуке (M5 Pro) со скоростью около 26 токенов в секунду, а 1-битная умещается в 3.9 ГБ и генерирует около 11 токенов в секунду на iPhone 17 Pro Max, или около 30 слов в секунду. Это первый случай, когда модель такого класса запускается на телефоне.
Обычное квантование ниже 4–5 бит ломает модели резко, а не постепенно. Текст остаётся гладким и уверенным, но рассуждения начинают противоречить сами себе, вызовы инструментов перестают парситься. До сих пор это обходили только обучением с нуля сразу в низкобитном виде (подход BitNet от Microsoft), но такие модели упёрлись в ~2B параметров. Bonsai конвертирует уже готовую предобученную модель, и главный результат именно в этом: считалось, что при сжатии ниже 4 бит модели ломаются сами по себе, но выяснилось, что дело в методах квантования.
Тернарный значит «троичный». Это способ хранения весов, при котором каждый вес принимает только одно из трёх значений: −1, 0 или +1. В обычной модели каждый вес — это число с плавающей точкой (FP16), например 0.0374, и на него уходит 16 бит. В бинарной модели вес может быть только −1 или +1, то есть хранится один бит, по сути только знак. Ноль здесь важен, потому что даёт модели возможность «выключить» связь между нейронами, то есть сказать «этот вход вообще не влияет на выход». Тернарная версия точнее, а бинарная компактнее.
Усредненные показатели по 15 бенчмаркам от математики и кода до вызова инструментов и работы с изображениями показывают, что деградация ответов по сравнению с исходной Qwen3.6-27B составляет 5.4% у Ternary Bonsai - 80,49 пртив 85.07 и 11.5% у 1-bit Bonsai, которая показала средний бал 76.11. Сравнение проводилось по единой методике на базе EvalScope с vLLM на NVIDIA H100 в режиме рассуждений, где деградация ниже 4 бит проявляется сильнее всего. Тернарная и бинарная версии теряют заметные баллы на агентных задачах и зрении относительно FP16.
Веса обеих версий выложены на Hugging Face, код на GitHub под лицензией Apache 2.0, а попробовать модель можно в браузере.
#Stateoftheart
❤ 9 👍 7 🔥 5 · всего 23
Перейти к публикации →
🎮 MIRA: нейросеть полностью симулирует Rocket League для четырёх игроков в 20 FPS, не требуя установки игры
General Intuition, Kyutai и Epic Games представили MIRA — мировую модель, которая полностью симулирует игровую среду Rocket League сразу для четырёх игроков и рисует каждому свою картинку в реальном времени.
Движка игры внутри нет вообще. Ни физического движка, который считает столкновения мяча и машин, ни рендерера, который рисует арену. Всё это заменяет одна нейросеть, которая по нажатиям кнопок сама дорисовывает следующий кадр. Игра целиком «живёт» внутри весов модели, поэтому запустить её можно локально, без установки оригинальной Rocket League.
Под капотом диффузионный трансформер на 5B параметров. Он предсказывает не пиксели напрямую, а сжатое скрытое представление кадра поверх замороженного экстрактора признаков DINOv3-L: кадры сначала сжимает видео-кодек, модель предсказывает следующий скрытый кадр, а декодер разворачивает его обратно в картинку. Работает в реальном времени: 20 FPS на одной Nvidia B200. Обучена на 10 000 часов матчей 2 на 2, полностью сыгранных ботами.
Четыре картинки согласованы благодаря тому, что ракурсы игроков складывают в одну сетку и предсказывают вместе. Пространственное внимание охватывает четыре представления, и модель рисует общий мир, мяч и чужие машины одинаково со всех четырёх ракурсов за один проход. Физическое состояние игры (позиции, скорости, ориентации мяча и машин) логируется отдельно на 120 Гц. Мировая модель его не видит и учится только на пикселях и действиях. Это состояние нужно как эталонная разметка для проверки: по нему авторы смотрят, кодирует ли модель в своих признаках физически осмысленные величины.
Видео-кодек MIRA даёт заметный рост качества по сравнению с предсказанием прямо в пикселях. Метрики gFID и gFVD измеряют, насколько сгенерированное видео похоже на настоящее (чем меньше, тем лучше): с кодеком 10.7 и 163.1 против 104.9 и 1456.3 без него. Метрика ARR показывает, насколько точно модель отрисовывает нажатые кнопки (1.0 = идеал): с кодеком 0.91 против 0.61. На практике без кодека картинка сваливается в искажённую текстуру уже через секунду.
Авторы опубликовали код обучения и инференса на Github, а также датасет на Hugging Face. Поиграть самостоятельно можно в демо-режиме на сайте проекта.
#Stateoftheart
🔥 10 ❤ 4 👍 2 · всего 17
Перейти к публикации →
⚡Выбирать железо для обучения и инференса моделей больше не нужно
Qwen, Whisper, Deepseek и другие нейросети уже готовы к работе на приватной инфраструктуре. Просто выбираете нужную модель и получаете готовый инференс-сервис в пару кликов в Selectel.
Каталог ИИ-моделей Selectel — удобный инструмент для работы с нейросетями, когда нужны безопасность и производительность.
Что вы получаете в пару кликов:
⚡Большой выбор моделей для ваших задач: для генерации текстов и кода, распознавания речи, создания контента и других.
⚡Производительность и гибкое масштабирование. Инференс-сервис развернут на современном железе с актуальными видеокартами и автоматически адаптируется при росте или снижении нагрузки.
⚡Прогнозируемая стоимость: платите за фактическое время потребления вычислительных ресурсов.
Начните работать с ИИ-моделями на выделенной инфраструктуре: https://slc.tl/ibq7g
Реклама, АО «Селектел», erid: 2VtzqwFqJdw
Claude Sonnet 5: сильный агентный апгрейд, но не очевидная замена Opus
Anthropic представила Claude Sonnet 5 — новую модель из линейки Claude, доступную в том числе пользователям бесплатного тарифа. Она ориентирована на агентные задачи, программирование, работу с инструментами и корпоративную автоматизацию. По данным Artificial Analysis, Sonnet 5 набрала 53 балла в Intelligence Index и стала моделью №5 в рейтинге по общему интеллекту модели. Она отстает от GPT-5.5 и Claude Opus 4.8 всего на 2–3 балла, от Fable — на 7 баллов, а по сравнению с Sonnet 4.6 прибавила 6 баллов на максимальном уровне рассуждений.
В кодинге прирост тоже заметен. Cursor сообщил, что на CursorBench — тесте реальных многофайловых задач из Cursor — Sonnet 5 набрала 57% против 49% у Sonnet 4.6.
Но главный нюанс — стоимость. В тестах Artificial Analysis одна задача на Sonnet 5 при стандартной цене API стоила примерно в 2 раза дороже Sonnet 4.6 и на 15% дороже Opus 4.8. Причина — повышенный расход: Sonnet 5 генерировала на 40% больше выходных токенов и делала примерно в 3 раза больше агентных шагов на выполнение рабочих задач: поиск информации, анализ документов и подготовку решений.
На стоимость влияет и новый токенизатор. Simon Willison проверил одни и те же тексты и получил рост числа токенов на входе: английский текст стал тратить примерно в 1.4 раза больше токенов, испанский — в 1.33 раза, Python-код — в 1.28 раза. Для упрощенного китайского текста разницы почти не было.
CodeRabbit тоже дает смешанную оценку. Для ревью кода Sonnet 5 стала точнее: precision вырос с 29% у Sonnet 4.6 до 38–40%. Но по нахождению багов результат хуже: Sonnet 5 нашла около 51% багов, а Sonnet 4.6 — около 63%. Усиление глубины рассуждений почти не улучшало результат, а стоимость при этом почти удвоилась.
Вывод: Claude Sonnet 5 стала сильнее Sonnet 4.6 в кодинге и агентных задачах, но это не делает ее новой флагманской моделью Anthropic. Opus 4.8 по-прежнему сильнее в сложных задачах на глубокие рассуждения, а Sonnet 5 обходит его только в двух бенчмарках из десятков. Зато Sonnet 5 доступна пользователям бесплатного тарифа Claude.
#AInews
👍 3 ❤ 1 ❤🔥 1
Перейти к публикации →
LFM2.5-230M: ультракомпактная модель работает на Raspberry Pi и почти любом современном телефоне
Команда Liquid AI выпустила LFM2.5-230M — одну из самых маленьких языковых моделей на сегодня, всего на 230 миллионов параметров. Модели хватает 293 МБ памяти на Raspberry Pi 5 и 375 МБ на смартфоне. На Raspberry Pi 5 модель выдаёт 42 токена в секунду при декодировании, а на флагмане Galaxy S25 Ultra разгоняется до 213 т/с. Человек читает текст со скоростью примерно 5–7 т/с. На бенчмарках модель конкурирует с моделями вдвое больше и часто их обходит.
Модель поставили на человекоподобного робота Unitree G1, и она работала на встроенном чипе NVIDIA Jetson Orin. Модель выступила в качестве слоя выбора навыков: берёт одну команду на обычном языке вроде «постой 2 секунды, потом иди вперёд со скоростью 1 м/с на 3 метра» и раскладывает её на последовательность вызовов готовых низкоуровневых навыков. Получается, что модель на 230 миллионов параметров может служить языковым интерфейсом управления для робота.
Главное ограничение модели простое: ей нужно около 350MB RAM и более-менее современный процессор. Прямыми тестами авторов подтверждены запуск на одноплатнике Raspberry Pi 5. Заявлена поддержка чипов Apple, AMD, Qualcomm и Nvidia, ее потянет почти любой современный телефон или планшет, а на ноутбуках ресурсов с запасом. Часы тоже теоретически потянут, но на практике мешают нагрев и неемкая батарейка. Микроконтроллеры и простая бытовая электроника (чайники, лампочки, фитнес-браслеты, наушники) точно не потянут: там памяти килобайты, а не сотни мегабайт.
Несмотря на размер, на бенчмарках модель обходит соперников вдвое крупнее. На тесте следования инструкциям IFEval она набрала 71.71 против 63.49 у Gemma 3 1B и 59.94 у Qwen3.5-0.8B. Сильнее всего она в вызове инструментов и извлечении данных, а вот для математики, кода и сложных рассуждений авторы её брать не советуют — она заточена под другое.
Модель и веса можно скачать на Hugging Face, исходники и SDK лежат на Github.
#Stateoftheart
❤🔥 4 ❤ 3 👍 3 · всего 13
Перейти к публикации →
Выбираем железо для обучения и инференса моделей 🔝
Простая формула: чем больше у модели параметров, тем более мощное железо нужно для ее инференса. Найти решение для нейросетей разного масштаба можно в Selectel.
Более 15 моделей видеокарт — от RTX 4090 до B300 — доступны к аренде в облаке и на выделенных серверах. Облачные серверы подойдут для тех, кому нужна гибкость и быстрая масштабируемость, а выделенные — когда необходима физическая изоляция инфраструктуры, а нагрузки стабильные. Видеокарты в облаке можно арендовать даже на час, цена стартует от 5 рублей.
Выбирайте оптимальный сервер с видеокартой и арендуйте его от 5 рублей в час: https://slc.tl/rqf62
Реклама, АО «Селектел», erid: 2Vtzqwcao6q
DreamX-World-5B: открытая модель генерации мира с контролем камеры, текстовым управлением и запоминанием локаций
Команда AMAP-ML опубликовала DreamX-World 1.0 — интерактивную генеративную модель мира, которая превращает текст или изображение в управляемое видео с точным контролем камеры, памятью о ранее посещённых сценах и поддержкой добавления событий по текстовым промптам. Модель работает в фотореалистичных, игровых и стилизованных визуальных доменах.
Исследователи дообучили базовую модель Wan2.2-TI2V поэтапно: сначала для управления камерой, затем для долгосрочной памяти о сцене, событийного управления и авторегрессивной генерации длинных видео. На восьми GPU RTX 5090 модель работает в реальном времени со скоростью до 16 FPS.
DreamX-World 1.0 — единственная публично доступная модель, поддерживающая все пять уровней управления действиями: реакцию на текстовые промпты, события на уровне отдельных объектов, привязку событий к области кадра, комбинирование нескольких сущностей в одной инструкции и взаимодействие между объектами. Конкуренты частично покрывают первые два-три уровня, но не дают полноценного управления несколькими взаимодействующими объектами одновременно.
DreamX-World с 5B параметров обгоняет модели большего размера по ключевым метрикам и при этом работает в реальном времени. В слепом исследовании предпочтений людей DreamX-World выигрывает у конкурентов: HY-WorldPlay (8B) в 57.5% случаев и у LingBot-World (14B) в 61.9% по общему впечатлению.
Моделирование мира — это комплексная задача: подготовка данных, поэтапное обучение, оценка и оптимизация инференса должны проектироваться вместе, а не отдельно друг от друга. Если решить только архитектурную часть и оставить медленный инференс, модель останется лабораторным прототипом, не пригодным для интерактивного использования. Если сосредоточиться только на скорости и забыть про память сцены, пользователь будет видеть, как окружение меняется при каждом повторном проходе, и ощущение «настоящего мира» пропадёт.
Веса модели доступны на Hugging Face, код на GitHub.
#Stateoftheart
❤ 4 👍 4 🔥 1 · всего 10
Перейти к публикации →
История названий канала
14.08.2026
название
NeuroHive - Нейронные сети
→
Neurohive
Дата — момент, когда изменение заметил наш обход.
Rozetked
ВИЛСАКОМ РЕД / WYLSACOM RED
Библиотека программиста
[netstalkers]
Типичный программист
СТАС БОМБИТ