I write about Open Data, Procurement, e-Government, Open Government, Budgets, Privacy and other govtech stuff Chat https://telegram.me/begtinchat Facebook - https://facebook.com/ibegtin Secure contacts ivan@begtin.tech
9 130подписчиков сейчас
56.0%ERR
31.0цитируемость
2постов/день
Русскийязык
Россиягео
Подписаться в Telegram
Данные обновлены 22.07.2020
Публикации всего: 80
Очередное обновление реестра каталогов данных Dateno, теперь достигнута планка в 25 тысяч каталогов данных большая часть которых - это порталы геоданных и геопорталы, далее репозитории научных данных и далее уже порталы открытых данных.
Основные обновления касались добавления огромного числа репозиториев научных данных и порталов научных данных, сложность с ними всегда была в том что часто это институциональные репозитории в которых могут быть, а могут и не быть наборы данных. И вот отсев вторых от первых и требовал много времени. Теперь он завершился и в реестре в общей сложности 6299 каталога научных данных в том числе по неохваченным ранее развивающимся странам.
Тут я напомню что число каталогов данных в разбивке по типу ПО, типу каталога, странам и тд. - это не показатель объёмов набора данных, это показатель системности того как в стране с данными работают. Обычно это коррелирует с числом датасетов, но это не 100% корреляция.
Например, по России есть 291 каталог с данными, почти как в Швеции где их 303. А более всего их в США, Германии и Франции, что тоже логично.
В целом там прямые корреляции с вхождением стран в G7 / ОСЭР / G20. Что тоже логично.
#opendata #datacatalogs #data
👍 2 ✍ 1
Перейти к публикации →
В России стартовали дебаты кандидатов в депутаты Государственной думы IX созыва. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио России», «Маяк» и «Вести ФМ».
В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в канале, по относительно горячим следам так и не удалось обнаружить записей семи эфиров.
Если архивация основных радиостанций налажена достаточно давно и основательно (в Telegram есть канал-бот https://t.me/RadioBot, позволяющий прослушать любой час эфира, начиная с 2018 года), то с телеэфиром всё несколько сложнее. Есть ресурс https://www.ontvtime.ru , где для некоторых телеканалов можно "отмотать эфир" на пару недель назад, теоретически можно использовать его для подстраховки. Но лучшим решением было бы записать трансляции теледебатов с эфира и организовать раздачу всего пакета на торрент-трекерах.
Телевизионная часть дебатов стартует 31 августа, полное расписание известно:
Первый канал
31 августа 7:05-7:45
1 сентября 7:05-7:45
2 сентября 7:05-7:45
3 сентября 7:05-7:45
4 сентября 7:05-7:45
7 сентября 7:05-7:45
8 сентября 7:05-7:45
9 сентября 7:05-7:45
10 сентября 7:05-7:45
11 сентября 7:05-7:45
Россия 1
1 сентября 23:30-0:45
2 сентября 23:30-0:45
3 сентября 23:30-0:45
8 сентября 23:30-0:45
9 сентября 23:30-0:45
Россия 24
1 сентября 19:00-20:00
2 сентября 19:00-20:00
3 сентября 19:00-20:00
8 сентября 19:00-20:00
9 сентября 19:00-20:00
10 сентября 19:00-20:00
ТВ Центр
1 сентября 17:00-17:50
2 сентября 17:00-17:50
7 сентября 17:00-17:50
8 сентября 17:00-17:50
9 сентября 17:00-17:50
10 сентября 17:00-17:50
ОТР
31 августа 10:00-11:00
2 сентября 10:00-11:00
4 сентября 10:00-11:00
7 сентября 10:00-11:00
9 сентября 10:00-11:00
11 сентября 10:00-11:00
Мы просим помощи в записи федеральных телебатов. Присылайте ссылки сразу в чат @ruarxivechat.
#archives #elections #helpneeded
👍 2 ❤ 1 🔥 1 · всего 6
Перейти к публикации →
Научные данные России: с чего начинать
Земля, океан, климат
ЕСИМО — http://esimo.ru
Тема: океан, метеорология, гидрология.
Ценность: единая государственная система Росгидромета об обстановке в Мировом океане — официальный контур морских и гидрометеоданных, а не институтский архив.
Всемирный центр данных по метеорологии (Обнинск) — http://meteo.ru/mcd/ewdcmet.html
Тема: метеорология.
Ценность: российский узел сети World Data Centres: сбор и распространение метеоданных внутри страны и в международном обмене (ВНИИГМИ–МЦД).
Всемирный центр радиационных данных (WRDC) — http://wrdc.mgo.rssi.ru/
Тема: климат, солнечная радиация.
Ценность: один из шести мировых центров программы GAW ВМО; архив актинометрических наблюдений ГГО им. Воейкова.
Всемирный центр данных по солнечно-земной физике (Москва) — http://www.wdcb.ru/stp/index.en.html
Тема: геофизика, космос.
Ценность: архив наблюдений солнечно-земной физики Геофизического центра РАН.
Геомагнитный центр ГЦ РАН — https://geomag.gcras.ru/
Тема: геомагнетизм.
Ценность: данные обсерваторий INTERMAGNET по России и ближнему зарубежью, плюс спутниковые продукты (система MAGNUS).
Астрономия и физика
Центр астрономических данных ИНАСАН — https://www.inasan.ru/en/divisions/dpss/cad/
Тема: астрономия.
Ценность: с 1980 года российский филиал CDS Strasbourg; каталоги звёзд, переменных и двойных систем для отечественной астрономии.
SPECTR-W3 — http://spectr-w3.snz.ru/index.phtml
Тема: атомная спектроскопия, физика плазмы.
Ценность: одна из крупнейших баз по спектрам атомов и высокозарядных ионов (РФЯЦ–ВНИИТФ): уровни, линии, вероятности переходов, сечения.
Биоразнообразие и коллекции
Российский GBIF IPT — http://gbif.ru:8080/ipt/
Тема: биоразнообразие.
Ценность: национальный узел публикации occurrence-данных в GBIF (ИМПБ РАН / ИПМ им. Келдыша).
«Ноев ковчег», МГУ — https://depo.msu.ru/ipt/
Тема: живые системы, биоматериалы.
Ценность: депозитарий МГУ — от молекул до организмов; наборы публикуются в GBIF.
IPT ЗИН РАН и БИН РАН — https://ipt.zin.ru
Тема: зоология и ботаника.
Ценность: данные крупнейших академических коллекций — Зоологического и Ботанического институтов РАН.
IPT Института океанологии им. Ширшова — https://gbif.ocean.ru/ipt/
Тема: морская биология.
Ценность: встречи, плотность и биомасса видов с экспедиций ИО РАН.
Молекулярная биология (российские базы мирового уровня)
CSDB — https://csdb.glycoscience.ru/database/
Тема: гликомика.
Ценность: курируемая база природных углеводных структур с таксономией, литературой и ЯМР (ИОХ РАН).
GTRD — https://gtrd.biouml.org/
Тема: регуляция транскрипции.
Ценность: сайты связывания транскрипционных факторов по ChIP-seq для человека и мыши.
HOCOMOCO — https://hocomoco11.autosome.org/
Тема: геномика, мотивы ДНК.
Ценность: модели связывания 680 человеческих и 453 мышиных транскрипционных факторов (PWM по ChIP-seq из GTRD).
VDJdb — https://vdjdb.com/
Тема: иммунология, TCR.
Ценность: курируемая база Т-клеточных рецепторов с известной антигенной специфичностью (ИБХ РАН).
EpiFactors — https://epifactors.autosome.org/
Тема: эпигенетика.
Ценность: белки и комплексы эпигенетической регуляции плюс экспрессия в клетках, раковых линиях и тканях (МФТИ).
Медицина и ML
MosMedData — https://mosmed.ai/datasets
Тема: медицинская визуализация.
Ценность: открытые КТ-наборы (в т.ч. COVID-19) Центра диагностики и телемедицины ДЗМ — готовые датасеты для обучения моделей.
Medical Data Hub — https://medicaldatahub.ru/datasets/
Тема: медицинские датасеты для ML.
Ценность: каталог медицинских наборов под машинное обучение.
Гуманитаристика, соцнауки, вузы
Dataverse Пушкинского Дома — https://dataverse.pushdom.ru
Тема: русская литература и фольклор.
Ценность: открытые исследовательские данные ИРЛИ РАН с DOI.
Репозиторий психологических данных — https://ruspsydata.figshare.com
Тема: психология.
Ценность: данные и инструменты исследований МГППУ.
DSpace СПбГУ — https://dspace.spbu.ru
Тема: университетский репозиторий.
Ценность: публикации, диссертации и датасеты сообщества СПбГУ (есть API DSpace 7).
#opendata #datasets #russia #researchdata
🔥 8 👏 5 ✍ 3 · всего 19
Перейти к публикации →
Полезные ссылки про данные, технологии и не только:
- Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом
- ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna
#dataengineering #aiagents
👍 4 ⚡ 2 🔥 2 · всего 9
Перейти к публикации →
Ещё одно наблюдение, то что с развитием ИИ агентов появилось множество порталов показывающих национальную и международную статистику наглядно, вот, например, такой по Монголии data.mn. Они все используют официальную статистику с сайтов нац. стат. служб и из баз данных межгосударственных структур. И вот таких порталов я видел уже штук 7 за неделю и несколько глобальных, охватывающих все страны.
В чем их особенности:
- как правило это one-man-project, делаются они одним человеком с помощью Claude / Cursor / Copilot / ChatGPT и далее по списку
- большая часть делается просто для портфолио, без бизнес модели. Исключения в тех что пытаются "засрать поисковую выдачу" с акцентом на SEO. В их бизнес модель я не верю.
- всегда акцент на визуализации, то что национальные статслужбы не умеют
- но про пользователей их создатели понимают редко, частотные (часто обновляемые) показатели у них есть редко.
Когда-то много таких проектов делала команда DataWheel (DataUSA, DataSaudi и др.), но там был явно не один человек, больше акцент на визуализации и работа всегда под клиентов.
Вот эти новые проекты пока до их уровня не дотягивают, но это скорее вопрос понимания природы данных и пользователей у их создателей, чем техническая невозможность.
#opendata #datasets #datacatalogs #datavis #statistics
❤ 4 🔥 3 ✍ 1
Перейти к публикации →
В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет aikosh для Python для работы с порталом, оценку качества каждого набора данных, четкие условия использования (в основном CC-BY-NC-SA) и так далее.
Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее.
#opendata #ai #india #datacatalogs #datasets
🔥 3 ✍ 1
Перейти к публикации →
В рубрике закрытых открытых данных в России портал открытых данных города Твери opendata.tver.ru недоступен и теперь перенаправляет на сайт администрации города www.tver.ru в последний раз сайт наблюдался в Интернет архиве в октябре 2024 года.
Портал данных города Перми opendata.gorodperm.ru содержит всего два набора данных "Режим работы" и "Телефонный справочник", бессмысленные для любой работы.
Портал данных Иркутска opendata.admirk.ru содержит лишь один набор данных "Структура аппарата администрации города Иркутска".
Это к вопросу о том почему многочисленные российские "порталы открытых данных" регионов и муниципалитетов бессмысленно добавлять в поисковые индексы или реестры каталогов данных. Они пустые или бессмысленные или уже не существуют.
#opendata #russia #datacatalogs
😢 4 ✍ 1
Перейти к публикации →
Кстати пример портала с именно с дата продуктами - это Source Cooperative портал нового поколения с акцентом на данные машинного обучения и геоданные. Там много данных большого объёма, в сотни гигабайт, преимущественно в форматах Parquet.
При этому внутри он устроен достаточно просто, это файловый навигатор по S3 хранилищу и описание в виде Markdown файла README.md которое и отображает как карточка продукта. Описание может быть как очень коротким так и весьма подробным со схемами данных, примерами кода, областями покрытия. Все отдано на откуп куратору дата продукта, а, поскольку курируют они сами, то и описано чаще хорошо чем плохо.
Главный минус такого подхода в том что доступ к данным не универсален. Каждый продукт имеет свою структуру файлов, свои примеры кода и тд. Чтобы подключиться к ним надо прочитать документацию, разобраться и тд.
Главный плюс в том что там хранятся данные большого объема, некоторые коллекции геоданных достигают сотен терабайт и в том что документацию всё равно читать надо.
Мне их каталог более всего напоминает бывший Quilt Data, а теперь Quilt.Bio которые тоже делали платформу для больших научных дата продуктов и тоже поверх S3 и с акцентом на документацию.
Тут важно, конечно, то что Source Cooperative - это инициатива Radiant Earth, НКО в области геоданных и их дата продукты ориентированы на некоммерческое использование и сама их платформа для публикации данных бесплатна. Поэтому их подход к дата продуктам скорее можно описать как то что они пытаются перенести практики создания коммерческих дата продуктов в некоммерческий сектор, пытаясь привести открытые данные в современный и более удобоваримый формат.
#opendata #datacatalogs #datasets #geodata
В рубрике как это устроено у них портал открытых геномных данных JGI DataPortal департамента энергетики США. Включает данные и метаданные с геномной информацией. Общий объём более 13ПБ, поддерживается Университетом Калифорнии.
Это специализированный портал научных данных, один из многих общедоступных порталов с геномной информацией, заточенный под исследователей в этой области.
Включает возможность выгрузки данных через систему Globus, получение метаданных через API и т.д.
#opendata #USA #genomic #datasets
👍 4 ✍ 1
Перейти к публикации →
В рубрике как это устроено у них официальный портал открытых данных Азербайджана opendata.az
Включает 836 наборов данных от 25 организаций. Почти все наборы данных статистические, почти нет геоданных. Работает на базе PortalJS с движком CKAN на бэкэнде.
Так и хочется сказать что даже у Азербайджана есть официальный портал открытых данных, а у Армении нет (c)
#opendata #datasets #datacatalogs
👍 3 ✍ 1 🤣 1
Перейти к публикации →
Бизнес Идеи 2.0
AVENUE | Бизнес Лента
Трансформатор
Аяз
Тёмная сторона / Темнографика
Бизнес Идеи Стартапы