Многие пишут про ox-alpha "скрытую" модель на OpenRouter где не указано кто её создатель, но можно моделью бесплатно воспользоваться. Много разных есть догадок о том кто за ней стоит и кто бы это не был - это неплохой, но, явно, очень дорогой маркетинг. Сейчас все бросились её тестировать и писать о ней, а потом все начнут писать о том кто же за ней когда создатель всплывёт наружу.
И напишут потому что модель вполне себе качественно работает как минимум на задачах кодирования, анализа и работы с данными. По субъективным ощущениям не хуже GLM-5.3, а может и даже лучше.
#ai #datatools
И напишут потому что модель вполне себе качественно работает как минимум на задачах кодирования, анализа и работы с данными. По субъективным ощущениям не хуже GLM-5.3, а может и даже лучше.
#ai #datatools
✍7👍4🤔2❤1👏1
В рубрике как это устроено у них портал открытых данных Монголии opendata.gov.mn. Всего 57 организаций, 7890 наборов данных и 21856 файлов на 25 августа 2026 г. Раньше их портал работал на базе движка CKAN, теперь там какой-то собственный движок, так что автоматически быстро не проверить объёмы данных и содержимое по типам и тд. Практически все данные это статистика и административные реестры (перечни предприятий, организаций и тд.). Форматы CSV, JSON, XLSX. Нет общедоступного API и в целом выглядит как каталог данных для начальства, потому что уж очень сильно статистика выпячена на главной, явно чтобы показать масштабы и востребованность.
Я бы на такой каталог данных не стал бы ориентироваться на эталонный, но как пример национального портала открытых данных в Азии он вполне нагляден.
#opendata #data #datasets #datacatalogs #mongolia
Я бы на такой каталог данных не стал бы ориентироваться на эталонный, но как пример национального портала открытых данных в Азии он вполне нагляден.
#opendata #data #datasets #datacatalogs #mongolia
✍4❤2🤔1
Я тут затеял большое обновление реестра каталогов данных Dateno с помощью фронтирных LLM, преимущественно через Cursor, но не только. Главные ощутимые изменения в применении именно последних моделей в том что они гораздо лучше понимают контекст и предыдущий накопленный опыт в правилах и гайдах и в том что они гораздо лучше вносят исправления сразу во множество файлов.
Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.).
Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения.
Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут.
При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила.
Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей.
К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств.
Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith.
Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее.
#thoughts #ai #datacatalogs
Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.).
Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения.
Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут.
При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила.
Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей.
К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств.
Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith.
Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее.
#thoughts #ai #datacatalogs
Dateno
Dateno Registry and Dataset Search Engine
A next-generation data search service provides fast, comprehensive access to open datasets worldwide, with powerful filters and an API-first architecture for seamless integration.
👍7✍1🤔1
Хотите больших, очень больших, очень-очень больших данных? 2 петабайта архив за 2024 год проекта End of Term Web Archive по архивации деятельности правительства США. Делают они его в партнерстве с Internet Archive, которые обеспечивают техническую часть организации архивации. А сами данные хранятся на AWS в рамках спонсорского гранта от Amazon. Просмотреть сохраненные сайты можно на сайте GovArchive.us
#webarchives #data #datasets #USA
#webarchives #data #datasets #USA
End of Term Web Archive
Datasets
The End of Term Web Archive is a collaborative initiative that collects, preserves, and makes accessible United States Government websites at the end of presidential administrations.
❤🔥8👍5🔥3🤔2❤1✍1
В рубрике как это устроено у них официальный портал открытых данных Азербайджана opendata.az
Включает 836 наборов данных от 25 организаций. Почти все наборы данных статистические, почти нет геоданных. Работает на базе PortalJS с движком CKAN на бэкэнде.
Так и хочется сказать что даже у Азербайджана есть официальный портал открытых данных, а у Армении нет (c)
#opendata #datasets #datacatalogs
Включает 836 наборов данных от 25 организаций. Почти все наборы данных статистические, почти нет геоданных. Работает на базе PortalJS с движком CKAN на бэкэнде.
Так и хочется сказать что даже у Азербайджана есть официальный портал открытых данных, а у Армении нет (c)
#opendata #datasets #datacatalogs
👍3✍1🤣1
В рубрике как это устроено у них портал открытых геномных данных JGI DataPortal департамента энергетики США. Включает данные и метаданные с геномной информацией. Общий объём более 13ПБ, поддерживается Университетом Калифорнии.
Это специализированный портал научных данных, один из многих общедоступных порталов с геномной информацией, заточенный под исследователей в этой области.
Включает возможность выгрузки данных через систему Globus, получение метаданных через API и т.д.
#opendata #USA #genomic #datasets
Это специализированный портал научных данных, один из многих общедоступных порталов с геномной информацией, заточенный под исследователей в этой области.
Включает возможность выгрузки данных через систему Globus, получение метаданных через API и т.д.
#opendata #USA #genomic #datasets
👍4✍1
Кстати пример портала с именно с дата продуктами - это Source Cooperative портал нового поколения с акцентом на данные машинного обучения и геоданные. Там много данных большого объёма, в сотни гигабайт, преимущественно в форматах Parquet.
При этому внутри он устроен достаточно просто, это файловый навигатор по S3 хранилищу и описание в виде Markdown файла README.md которое и отображает как карточка продукта. Описание может быть как очень коротким так и весьма подробным со схемами данных, примерами кода, областями покрытия. Все отдано на откуп куратору дата продукта, а, поскольку курируют они сами, то и описано чаще хорошо чем плохо.
Главный минус такого подхода в том что доступ к данным не универсален. Каждый продукт имеет свою структуру файлов, свои примеры кода и тд. Чтобы подключиться к ним надо прочитать документацию, разобраться и тд.
Главный плюс в том что там хранятся данные большого объема, некоторые коллекции геоданных достигают сотен терабайт и в том что документацию всё равно читать надо.
Мне их каталог более всего напоминает бывший Quilt Data, а теперь Quilt.Bio которые тоже делали платформу для больших научных дата продуктов и тоже поверх S3 и с акцентом на документацию.
Тут важно, конечно, то что Source Cooperative - это инициатива Radiant Earth, НКО в области геоданных и их дата продукты ориентированы на некоммерческое использование и сама их платформа для публикации данных бесплатна. Поэтому их подход к дата продуктам скорее можно описать как то что они пытаются перенести практики создания коммерческих дата продуктов в некоммерческий сектор, пытаясь привести открытые данные в современный и более удобоваримый формат.
#opendata #datacatalogs #datasets #geodata
При этому внутри он устроен достаточно просто, это файловый навигатор по S3 хранилищу и описание в виде Markdown файла README.md которое и отображает как карточка продукта. Описание может быть как очень коротким так и весьма подробным со схемами данных, примерами кода, областями покрытия. Все отдано на откуп куратору дата продукта, а, поскольку курируют они сами, то и описано чаще хорошо чем плохо.
Главный минус такого подхода в том что доступ к данным не универсален. Каждый продукт имеет свою структуру файлов, свои примеры кода и тд. Чтобы подключиться к ним надо прочитать документацию, разобраться и тд.
Главный плюс в том что там хранятся данные большого объема, некоторые коллекции геоданных достигают сотен терабайт и в том что документацию всё равно читать надо.
Мне их каталог более всего напоминает бывший Quilt Data, а теперь Quilt.Bio которые тоже делали платформу для больших научных дата продуктов и тоже поверх S3 и с акцентом на документацию.
Тут важно, конечно, то что Source Cooperative - это инициатива Radiant Earth, НКО в области геоданных и их дата продукты ориентированы на некоммерческое использование и сама их платформа для публикации данных бесплатна. Поэтому их подход к дата продуктам скорее можно описать как то что они пытаются перенести практики создания коммерческих дата продуктов в некоммерческий сектор, пытаясь привести открытые данные в современный и более удобоваримый формат.
#opendata #datacatalogs #datasets #geodata
👍4
В рубрике закрытых открытых данных в России портал открытых данных города Твери opendata.tver.ru недоступен и теперь перенаправляет на сайт администрации города www.tver.ru в последний раз сайт наблюдался в Интернет архиве в октябре 2024 года.
Портал данных города Перми opendata.gorodperm.ru содержит всего два набора данных "Режим работы" и "Телефонный справочник", бессмысленные для любой работы.
Портал данных Иркутска opendata.admirk.ru содержит лишь один набор данных "Структура аппарата администрации города Иркутска".
Это к вопросу о том почему многочисленные российские "порталы открытых данных" регионов и муниципалитетов бессмысленно добавлять в поисковые индексы или реестры каталогов данных. Они пустые или бессмысленные или уже не существуют.
#opendata #russia #datacatalogs
Портал данных города Перми opendata.gorodperm.ru содержит всего два набора данных "Режим работы" и "Телефонный справочник", бессмысленные для любой работы.
Портал данных Иркутска opendata.admirk.ru содержит лишь один набор данных "Структура аппарата администрации города Иркутска".
Это к вопросу о том почему многочисленные российские "порталы открытых данных" регионов и муниципалитетов бессмысленно добавлять в поисковые индексы или реестры каталогов данных. Они пустые или бессмысленные или уже не существуют.
#opendata #russia #datacatalogs
web.archive.org
Портал открытых данных администрации города Твери
Портал Администрации города Твери
😢5✍1
В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет aikosh для Python для работы с порталом, оценку качества каждого набора данных, четкие условия использования (в основном CC-BY-NC-SA) и так далее.
Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее.
#opendata #ai #india #datacatalogs #datasets
Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее.
#opendata #ai #india #datacatalogs #datasets
🔥3🏆2✍1
Ещё одно наблюдение, то что с развитием ИИ агентов появилось множество порталов показывающих национальную и международную статистику наглядно, вот, например, такой по Монголии data.mn. Они все используют официальную статистику с сайтов нац. стат. служб и из баз данных межгосударственных структур. И вот таких порталов я видел уже штук 7 за неделю и несколько глобальных, охватывающих все страны.
В чем их особенности:
- как правило это one-man-project, делаются они одним человеком с помощью Claude / Cursor / Copilot / ChatGPT и далее по списку
- большая часть делается просто для портфолио, без бизнес модели. Исключения в тех что пытаются "засрать поисковую выдачу" с акцентом на SEO. В их бизнес модель я не верю.
- всегда акцент на визуализации, то что национальные статслужбы не умеют
- но про пользователей их создатели понимают редко, частотные (часто обновляемые) показатели у них есть редко.
Когда-то много таких проектов делала команда DataWheel (DataUSA, DataSaudi и др.), но там был явно не один человек, больше акцент на визуализации и работа всегда под клиентов.
Вот эти новые проекты пока до их уровня не дотягивают, но это скорее вопрос понимания природы данных и пользователей у их создателей, чем техническая невозможность.
#opendata #datasets #datacatalogs #datavis #statistics
В чем их особенности:
- как правило это one-man-project, делаются они одним человеком с помощью Claude / Cursor / Copilot / ChatGPT и далее по списку
- большая часть делается просто для портфолио, без бизнес модели. Исключения в тех что пытаются "засрать поисковую выдачу" с акцентом на SEO. В их бизнес модель я не верю.
- всегда акцент на визуализации, то что национальные статслужбы не умеют
- но про пользователей их создатели понимают редко, частотные (часто обновляемые) показатели у них есть редко.
Когда-то много таких проектов делала команда DataWheel (DataUSA, DataSaudi и др.), но там был явно не один человек, больше акцент на визуализации и работа всегда под клиентов.
Вот эти новые проекты пока до их уровня не дотягивают, но это скорее вопрос понимания природы данных и пользователей у их создателей, чем техническая невозможность.
#opendata #datasets #datacatalogs #datavis #statistics
3❤4🔥3✍2
Полезные ссылки про данные, технологии и не только:
- Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом
- ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna
#dataengineering #aiagents
- Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом
- ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna
#dataengineering #aiagents
DuckDB
DuckLabs to Join AWS, Projects to Remain Open Source
DuckLabs will join Amazon Web Services (AWS), which is expected to be effective in early September. The projects will remain open-source under the MIT license.
👍5⚡2✍2🔥2
Научные данные России: с чего начинать
Земля, океан, климат
ЕСИМО — http://esimo.ru
Тема: океан, метеорология, гидрология.
Ценность: единая государственная система Росгидромета об обстановке в Мировом океане — официальный контур морских и гидрометеоданных, а не институтский архив.
Всемирный центр данных по метеорологии (Обнинск) — http://meteo.ru/mcd/ewdcmet.html
Тема: метеорология.
Ценность: российский узел сети World Data Centres: сбор и распространение метеоданных внутри страны и в международном обмене (ВНИИГМИ–МЦД).
Всемирный центр радиационных данных (WRDC) — http://wrdc.mgo.rssi.ru/
Тема: климат, солнечная радиация.
Ценность: один из шести мировых центров программы GAW ВМО; архив актинометрических наблюдений ГГО им. Воейкова.
Всемирный центр данных по солнечно-земной физике (Москва) — http://www.wdcb.ru/stp/index.en.html
Тема: геофизика, космос.
Ценность: архив наблюдений солнечно-земной физики Геофизического центра РАН.
Геомагнитный центр ГЦ РАН — https://geomag.gcras.ru/
Тема: геомагнетизм.
Ценность: данные обсерваторий INTERMAGNET по России и ближнему зарубежью, плюс спутниковые продукты (система MAGNUS).
Астрономия и физика
Центр астрономических данных ИНАСАН — https://www.inasan.ru/en/divisions/dpss/cad/
Тема: астрономия.
Ценность: с 1980 года российский филиал CDS Strasbourg; каталоги звёзд, переменных и двойных систем для отечественной астрономии.
SPECTR-W3 — http://spectr-w3.snz.ru/index.phtml
Тема: атомная спектроскопия, физика плазмы.
Ценность: одна из крупнейших баз по спектрам атомов и высокозарядных ионов (РФЯЦ–ВНИИТФ): уровни, линии, вероятности переходов, сечения.
Биоразнообразие и коллекции
Российский GBIF IPT — http://gbif.ru:8080/ipt/
Тема: биоразнообразие.
Ценность: национальный узел публикации occurrence-данных в GBIF (ИМПБ РАН / ИПМ им. Келдыша).
«Ноев ковчег», МГУ — https://depo.msu.ru/ipt/
Тема: живые системы, биоматериалы.
Ценность: депозитарий МГУ — от молекул до организмов; наборы публикуются в GBIF.
IPT ЗИН РАН и БИН РАН — https://ipt.zin.ru
Тема: зоология и ботаника.
Ценность: данные крупнейших академических коллекций — Зоологического и Ботанического институтов РАН.
IPT Института океанологии им. Ширшова — https://gbif.ocean.ru/ipt/
Тема: морская биология.
Ценность: встречи, плотность и биомасса видов с экспедиций ИО РАН.
Молекулярная биология (российские базы мирового уровня)
CSDB — https://csdb.glycoscience.ru/database/
Тема: гликомика.
Ценность: курируемая база природных углеводных структур с таксономией, литературой и ЯМР (ИОХ РАН).
GTRD — https://gtrd.biouml.org/
Тема: регуляция транскрипции.
Ценность: сайты связывания транскрипционных факторов по ChIP-seq для человека и мыши.
HOCOMOCO — https://hocomoco11.autosome.org/
Тема: геномика, мотивы ДНК.
Ценность: модели связывания 680 человеческих и 453 мышиных транскрипционных факторов (PWM по ChIP-seq из GTRD).
VDJdb — https://vdjdb.com/
Тема: иммунология, TCR.
Ценность: курируемая база Т-клеточных рецепторов с известной антигенной специфичностью (ИБХ РАН).
EpiFactors — https://epifactors.autosome.org/
Тема: эпигенетика.
Ценность: белки и комплексы эпигенетической регуляции плюс экспрессия в клетках, раковых линиях и тканях (МФТИ).
Медицина и ML
MosMedData — https://mosmed.ai/datasets
Тема: медицинская визуализация.
Ценность: открытые КТ-наборы (в т.ч. COVID-19) Центра диагностики и телемедицины ДЗМ — готовые датасеты для обучения моделей.
Medical Data Hub — https://medicaldatahub.ru/datasets/
Тема: медицинские датасеты для ML.
Ценность: каталог медицинских наборов под машинное обучение.
Гуманитаристика, соцнауки, вузы
Dataverse Пушкинского Дома — https://dataverse.pushdom.ru
Тема: русская литература и фольклор.
Ценность: открытые исследовательские данные ИРЛИ РАН с DOI.
Репозиторий психологических данных — https://ruspsydata.figshare.com
Тема: психология.
Ценность: данные и инструменты исследований МГППУ.
DSpace СПбГУ — https://dspace.spbu.ru
Тема: университетский репозиторий.
Ценность: публикации, диссертации и датасеты сообщества СПбГУ (есть API DSpace 7).
#opendata #datasets #russia #researchdata
Земля, океан, климат
ЕСИМО — http://esimo.ru
Тема: океан, метеорология, гидрология.
Ценность: единая государственная система Росгидромета об обстановке в Мировом океане — официальный контур морских и гидрометеоданных, а не институтский архив.
Всемирный центр данных по метеорологии (Обнинск) — http://meteo.ru/mcd/ewdcmet.html
Тема: метеорология.
Ценность: российский узел сети World Data Centres: сбор и распространение метеоданных внутри страны и в международном обмене (ВНИИГМИ–МЦД).
Всемирный центр радиационных данных (WRDC) — http://wrdc.mgo.rssi.ru/
Тема: климат, солнечная радиация.
Ценность: один из шести мировых центров программы GAW ВМО; архив актинометрических наблюдений ГГО им. Воейкова.
Всемирный центр данных по солнечно-земной физике (Москва) — http://www.wdcb.ru/stp/index.en.html
Тема: геофизика, космос.
Ценность: архив наблюдений солнечно-земной физики Геофизического центра РАН.
Геомагнитный центр ГЦ РАН — https://geomag.gcras.ru/
Тема: геомагнетизм.
Ценность: данные обсерваторий INTERMAGNET по России и ближнему зарубежью, плюс спутниковые продукты (система MAGNUS).
Астрономия и физика
Центр астрономических данных ИНАСАН — https://www.inasan.ru/en/divisions/dpss/cad/
Тема: астрономия.
Ценность: с 1980 года российский филиал CDS Strasbourg; каталоги звёзд, переменных и двойных систем для отечественной астрономии.
SPECTR-W3 — http://spectr-w3.snz.ru/index.phtml
Тема: атомная спектроскопия, физика плазмы.
Ценность: одна из крупнейших баз по спектрам атомов и высокозарядных ионов (РФЯЦ–ВНИИТФ): уровни, линии, вероятности переходов, сечения.
Биоразнообразие и коллекции
Российский GBIF IPT — http://gbif.ru:8080/ipt/
Тема: биоразнообразие.
Ценность: национальный узел публикации occurrence-данных в GBIF (ИМПБ РАН / ИПМ им. Келдыша).
«Ноев ковчег», МГУ — https://depo.msu.ru/ipt/
Тема: живые системы, биоматериалы.
Ценность: депозитарий МГУ — от молекул до организмов; наборы публикуются в GBIF.
IPT ЗИН РАН и БИН РАН — https://ipt.zin.ru
Тема: зоология и ботаника.
Ценность: данные крупнейших академических коллекций — Зоологического и Ботанического институтов РАН.
IPT Института океанологии им. Ширшова — https://gbif.ocean.ru/ipt/
Тема: морская биология.
Ценность: встречи, плотность и биомасса видов с экспедиций ИО РАН.
Молекулярная биология (российские базы мирового уровня)
CSDB — https://csdb.glycoscience.ru/database/
Тема: гликомика.
Ценность: курируемая база природных углеводных структур с таксономией, литературой и ЯМР (ИОХ РАН).
GTRD — https://gtrd.biouml.org/
Тема: регуляция транскрипции.
Ценность: сайты связывания транскрипционных факторов по ChIP-seq для человека и мыши.
HOCOMOCO — https://hocomoco11.autosome.org/
Тема: геномика, мотивы ДНК.
Ценность: модели связывания 680 человеческих и 453 мышиных транскрипционных факторов (PWM по ChIP-seq из GTRD).
VDJdb — https://vdjdb.com/
Тема: иммунология, TCR.
Ценность: курируемая база Т-клеточных рецепторов с известной антигенной специфичностью (ИБХ РАН).
EpiFactors — https://epifactors.autosome.org/
Тема: эпигенетика.
Ценность: белки и комплексы эпигенетической регуляции плюс экспрессия в клетках, раковых линиях и тканях (МФТИ).
Медицина и ML
MosMedData — https://mosmed.ai/datasets
Тема: медицинская визуализация.
Ценность: открытые КТ-наборы (в т.ч. COVID-19) Центра диагностики и телемедицины ДЗМ — готовые датасеты для обучения моделей.
Medical Data Hub — https://medicaldatahub.ru/datasets/
Тема: медицинские датасеты для ML.
Ценность: каталог медицинских наборов под машинное обучение.
Гуманитаристика, соцнауки, вузы
Dataverse Пушкинского Дома — https://dataverse.pushdom.ru
Тема: русская литература и фольклор.
Ценность: открытые исследовательские данные ИРЛИ РАН с DOI.
Репозиторий психологических данных — https://ruspsydata.figshare.com
Тема: психология.
Ценность: данные и инструменты исследований МГППУ.
DSpace СПбГУ — https://dspace.spbu.ru
Тема: университетский репозиторий.
Ценность: публикации, диссертации и датасеты сообщества СПбГУ (есть API DSpace 7).
#opendata #datasets #russia #researchdata
🔥11👏6✍5❤2❤🔥1
Forwarded from Национальный цифровой архив
В России стартовали дебаты кандидатов в депутаты Государственной думы IX созыва. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио России», «Маяк» и «Вести ФМ».
В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в канале, по относительно горячим следам так и не удалось обнаружить записей семи эфиров.
Если архивация основных радиостанций налажена достаточно давно и основательно (в Telegram есть канал-бот https://t.me/RadioBot, позволяющий прослушать любой час эфира, начиная с 2018 года), то с телеэфиром всё несколько сложнее. Есть ресурс https://www.ontvtime.ru , где для некоторых телеканалов можно "отмотать эфир" на пару недель назад, теоретически можно использовать его для подстраховки. Но лучшим решением было бы записать трансляции теледебатов с эфира и организовать раздачу всего пакета на торрент-трекерах.
Телевизионная часть дебатов стартует 31 августа, полное расписание известно:
Первый канал
31 августа 7:05-7:45
1 сентября 7:05-7:45
2 сентября 7:05-7:45
3 сентября 7:05-7:45
4 сентября 7:05-7:45
7 сентября 7:05-7:45
8 сентября 7:05-7:45
9 сентября 7:05-7:45
10 сентября 7:05-7:45
11 сентября 7:05-7:45
Россия 1
1 сентября 23:30-0:45
2 сентября 23:30-0:45
3 сентября 23:30-0:45
8 сентября 23:30-0:45
9 сентября 23:30-0:45
Россия 24
1 сентября 19:00-20:00
2 сентября 19:00-20:00
3 сентября 19:00-20:00
8 сентября 19:00-20:00
9 сентября 19:00-20:00
10 сентября 19:00-20:00
ТВ Центр
1 сентября 17:00-17:50
2 сентября 17:00-17:50
7 сентября 17:00-17:50
8 сентября 17:00-17:50
9 сентября 17:00-17:50
10 сентября 17:00-17:50
ОТР
31 августа 10:00-11:00
2 сентября 10:00-11:00
4 сентября 10:00-11:00
7 сентября 10:00-11:00
9 сентября 10:00-11:00
11 сентября 10:00-11:00
Мы просим помощи в записи федеральных телебатов. Присылайте ссылки сразу в чат @ruarxivechat.
#archives #elections #helpneeded
В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в канале, по относительно горячим следам так и не удалось обнаружить записей семи эфиров.
Если архивация основных радиостанций налажена достаточно давно и основательно (в Telegram есть канал-бот https://t.me/RadioBot, позволяющий прослушать любой час эфира, начиная с 2018 года), то с телеэфиром всё несколько сложнее. Есть ресурс https://www.ontvtime.ru , где для некоторых телеканалов можно "отмотать эфир" на пару недель назад, теоретически можно использовать его для подстраховки. Но лучшим решением было бы записать трансляции теледебатов с эфира и организовать раздачу всего пакета на торрент-трекерах.
Телевизионная часть дебатов стартует 31 августа, полное расписание известно:
Первый канал
31 августа 7:05-7:45
1 сентября 7:05-7:45
2 сентября 7:05-7:45
3 сентября 7:05-7:45
4 сентября 7:05-7:45
7 сентября 7:05-7:45
8 сентября 7:05-7:45
9 сентября 7:05-7:45
10 сентября 7:05-7:45
11 сентября 7:05-7:45
Россия 1
1 сентября 23:30-0:45
2 сентября 23:30-0:45
3 сентября 23:30-0:45
8 сентября 23:30-0:45
9 сентября 23:30-0:45
Россия 24
1 сентября 19:00-20:00
2 сентября 19:00-20:00
3 сентября 19:00-20:00
8 сентября 19:00-20:00
9 сентября 19:00-20:00
10 сентября 19:00-20:00
ТВ Центр
1 сентября 17:00-17:50
2 сентября 17:00-17:50
7 сентября 17:00-17:50
8 сентября 17:00-17:50
9 сентября 17:00-17:50
10 сентября 17:00-17:50
ОТР
31 августа 10:00-11:00
2 сентября 10:00-11:00
4 сентября 10:00-11:00
7 сентября 10:00-11:00
9 сентября 10:00-11:00
11 сентября 10:00-11:00
Мы просим помощи в записи федеральных телебатов. Присылайте ссылки сразу в чат @ruarxivechat.
#archives #elections #helpneeded
Telegram
Национальный цифровой архив in Обсуждаем цифровую архивацию
В России стартовали президентские выборы. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио…
👍5🔥3❤2😁1🗿1
Очередное обновление реестра каталогов данных Dateno, теперь достигнута планка в 25 тысяч каталогов данных большая часть которых - это порталы геоданных и геопорталы, далее репозитории научных данных и далее уже порталы открытых данных.
Основные обновления касались добавления огромного числа репозиториев научных данных и порталов научных данных, сложность с ними всегда была в том что часто это институциональные репозитории в которых могут быть, а могут и не быть наборы данных. И вот отсев вторых от первых и требовал много времени. Теперь он завершился и в реестре в общей сложности 6299 каталога научных данных в том числе по неохваченным ранее развивающимся странам.
Тут я напомню что число каталогов данных в разбивке по типу ПО, типу каталога, странам и тд. - это не показатель объёмов набора данных, это показатель системности того как в стране с данными работают. Обычно это коррелирует с числом датасетов, но это не 100% корреляция.
Например, по России есть 291 каталог с данными, почти как в Швеции где их 303. А более всего их в США, Германии и Франции, что тоже логично.
В целом там прямые корреляции с вхождением стран в G7 / ОСЭР / G20. Что тоже логично.
#opendata #datacatalogs #data
Основные обновления касались добавления огромного числа репозиториев научных данных и порталов научных данных, сложность с ними всегда была в том что часто это институциональные репозитории в которых могут быть, а могут и не быть наборы данных. И вот отсев вторых от первых и требовал много времени. Теперь он завершился и в реестре в общей сложности 6299 каталога научных данных в том числе по неохваченным ранее развивающимся странам.
Тут я напомню что число каталогов данных в разбивке по типу ПО, типу каталога, странам и тд. - это не показатель объёмов набора данных, это показатель системности того как в стране с данными работают. Обычно это коррелирует с числом датасетов, но это не 100% корреляция.
Например, по России есть 291 каталог с данными, почти как в Швеции где их 303. А более всего их в США, Германии и Франции, что тоже логично.
В целом там прямые корреляции с вхождением стран в G7 / ОСЭР / G20. Что тоже логично.
#opendata #datacatalogs #data
GitHub
GitHub - datenoio/dataportals-registry: Registry of data portals, catalogs, data repositories including data catalogs dataset and…
Registry of data portals, catalogs, data repositories including data catalogs dataset and catalog description standard - datenoio/dataportals-registry
👍5✍2🤔1
Forwarded from Privacy Advocates
🏛️ У «Алисы AI» могут появиться расширенные права на мобильных устройствах
🔸В Минцифры обсуждают доработку правил предустановки отечественных приложений на ввозимые в Россию устройства. В частности, расширяются требования, касающиеся российского браузера «Яндекс» и умного ИИ-помощника компании — «Алиса AI». Об этом “Ъ” рассказал источник, знакомый с ходом обсуждения инициативы, и подтвердил собеседник в крупной ИТ-компании. Обсуждения проекта проходили в конце августа.
🔸ИИ-помощник «Яндекса» может получить доступ к банковским приложениям на устройствах и другим, собирающим чувствительные данные, а хранить их на своих мощностях, добавляет собеседник “Ъ”. Изменения затрагивают не только смартфоны и планшеты, но и, например, колонки, оснащенные умными помощниками (Siri от Apple, Alexa от Amazon и Google Assistant).
🔸В начале августа Минцифры уже размещало для общественного обсуждения проект постановления, который обновляет действующие правила предустановки и вводит требование о предоставлении пользователю выбора системного помощника «при первом включении гаджета», писал «Интерфакс». Однако позже документ с портала правовых актов был удален и сейчас, по данным “Ъ”, дорабатывается.
🔸В частности, разрабатывается мера по предустановке «системного помощника ИИ, созданного на базе суверенных или национальных фундаментальных моделей ИИ». Такие типы моделей закреплены в принятом в июле законе «О поддержке развития искусственного интеллекта в РФ». Однако, указывают источники “Ъ”, инициатива прямо направлена на ограничения в России аналогичных зарубежных умных помощников, а также ИИ-моделей.
👁 PA | 💬 Max | ❤️ ЯМ | 🗣️ ВК
🔸В Минцифры обсуждают доработку правил предустановки отечественных приложений на ввозимые в Россию устройства. В частности, расширяются требования, касающиеся российского браузера «Яндекс» и умного ИИ-помощника компании — «Алиса AI». Об этом “Ъ” рассказал источник, знакомый с ходом обсуждения инициативы, и подтвердил собеседник в крупной ИТ-компании. Обсуждения проекта проходили в конце августа.
🔸ИИ-помощник «Яндекса» может получить доступ к банковским приложениям на устройствах и другим, собирающим чувствительные данные, а хранить их на своих мощностях, добавляет собеседник “Ъ”. Изменения затрагивают не только смартфоны и планшеты, но и, например, колонки, оснащенные умными помощниками (Siri от Apple, Alexa от Amazon и Google Assistant).
🔸В начале августа Минцифры уже размещало для общественного обсуждения проект постановления, который обновляет действующие правила предустановки и вводит требование о предоставлении пользователю выбора системного помощника «при первом включении гаджета», писал «Интерфакс». Однако позже документ с портала правовых актов был удален и сейчас, по данным “Ъ”, дорабатывается.
🔸В частности, разрабатывается мера по предустановке «системного помощника ИИ, созданного на базе суверенных или национальных фундаментальных моделей ИИ». Такие типы моделей закреплены в принятом в июле законе «О поддержке развития искусственного интеллекта в РФ». Однако, указывают источники “Ъ”, инициатива прямо направлена на ограничения в России аналогичных зарубежных умных помощников, а также ИИ-моделей.
Please open Telegram to view this post
VIEW IN TELEGRAM
😱15💊5👏2🤔1
Я сегодня доделал очередной большой апдейт реестра каталогов данных Dateno, там теперь 29 816 каталогов данных. Это уже больше чем вдвое того что было месяц назад - 14 436.
Подавляющее число новых каталогов данных за этот месяц и в последней сборке тоже - это геопорталы, научные репозитории данных и порталы статистики и индикаторов.
Причем теперь уже с весьма широким охватом региональных и муниципальных источников данных.
На эту тему у меня, как всегда, накопилось множество наблюдений, часть которых стоит записать.
Геоданные:
1. Геопорталов в мире сильно больше чем порталов открытых данных. Они бывают более данные-ориентированные вроде Geonetwork или Geonode, бывают более про API - ArcGIS Server, а бывает большое разнообразие интерфейсов где если и есть API то недокументированное.
2. Количественно геоданных в мире более всего, качественно (по объему) только если учитывать спутниковые снимки.
3. Esri - это абсолютная доминанта внедрений геопроектов в мире, повсеместно, либо ArcGIS Server, либо ArcGIS Hub. Open source стек вроде Geoserver и др. встречается существенно реже.
4. Много региональных/локальных геовендоров с внедрениями в 5-6 муниципалитетах. Наверное во всех странах высокого и среднего достатка такие есть.
Статистика:
5. Стандартизация в статистике сразу заканчивается после национальных агентств и международных структур. За их пределами нет не то что SDMX, но и облегченных вроде JSON Stat (за редким исключением).
6. SDMX оказался очень тяжелым при внедрении стандартом, есть всего 3 активно внедряемых серверных продукта и много вопросов с тем можно ли их внедрять без найма консультантов.
7. Вся самая интересная статистика и индикаторы за пределами национальных статслужб, там крайне редко есть еженедельные или ежесуточные показатели. Сбор интересного статистического дашборда - это всегда трудоемкая задача по поиску данных, и чаще они не на порталах данных
#opendata #datacatalogs #datasets #thoughts
Подавляющее число новых каталогов данных за этот месяц и в последней сборке тоже - это геопорталы, научные репозитории данных и порталы статистики и индикаторов.
Причем теперь уже с весьма широким охватом региональных и муниципальных источников данных.
На эту тему у меня, как всегда, накопилось множество наблюдений, часть которых стоит записать.
Геоданные:
1. Геопорталов в мире сильно больше чем порталов открытых данных. Они бывают более данные-ориентированные вроде Geonetwork или Geonode, бывают более про API - ArcGIS Server, а бывает большое разнообразие интерфейсов где если и есть API то недокументированное.
2. Количественно геоданных в мире более всего, качественно (по объему) только если учитывать спутниковые снимки.
3. Esri - это абсолютная доминанта внедрений геопроектов в мире, повсеместно, либо ArcGIS Server, либо ArcGIS Hub. Open source стек вроде Geoserver и др. встречается существенно реже.
4. Много региональных/локальных геовендоров с внедрениями в 5-6 муниципалитетах. Наверное во всех странах высокого и среднего достатка такие есть.
Статистика:
5. Стандартизация в статистике сразу заканчивается после национальных агентств и международных структур. За их пределами нет не то что SDMX, но и облегченных вроде JSON Stat (за редким исключением).
6. SDMX оказался очень тяжелым при внедрении стандартом, есть всего 3 активно внедряемых серверных продукта и много вопросов с тем можно ли их внедрять без найма консультантов.
7. Вся самая интересная статистика и индикаторы за пределами национальных статслужб, там крайне редко есть еженедельные или ежесуточные показатели. Сбор интересного статистического дашборда - это всегда трудоемкая задача по поиску данных, и чаще они не на порталах данных
#opendata #datacatalogs #datasets #thoughts
GitHub
GitHub - datenoio/dataportals-registry: Registry of data portals, catalogs, data repositories including data catalogs dataset and…
Registry of data portals, catalogs, data repositories including data catalogs dataset and catalog description standard - datenoio/dataportals-registry
👍5✍3❤2🔥2
В рубрике как это устроено у них data.museum.wa.gov.au портал открытых данных Музея Западной Австралии. Наборов данных там немного, сделан он на базе DKAN ПО с открытым кодом для публикации открытых данных и совместимое с CKAN по основному своему API. В отличие от CKAN он устроен проще и легче в развертывании, а также основан на Drupal в отличии от более комплексного CKAN написанного на Python.
Этот портал один из редких порталов открытых данных музеев, а сами наборы данных описывают их экспозиции.
Другие примеры музеев публикующих открытые данные:
- API Пушкинского музея в России
- API Rijks Museum в Голландии
- Данные Natural History Museum в Великобритании
И многие другие. Как-нибудь сделаю небольшой обзор.
#opendata #museums #australia #datacatalogs
Этот портал один из редких порталов открытых данных музеев, а сами наборы данных описывают их экспозиции.
Другие примеры музеев публикующих открытые данные:
- API Пушкинского музея в России
- API Rijks Museum в Голландии
- Данные Natural History Museum в Великобритании
И многие другие. Как-нибудь сделаю небольшой обзор.
#opendata #museums #australia #datacatalogs
👍4⚡2❤2
В рубрике открытых российских данных портал по биоразнообразию Северной части Западной Сибири bioportal.ugrasu.ru
Создан в Югорском государственном университете вначале на грант Евросоюза и далее за счет Президентского гранта. Работает на базе ПО Specify платформе с открытым кодом для собственного или облачного хостинга. В мире не меньше десятка отдельных инсталляций этого продукта и несколько десятков участвующих организаций.
А также эти данные публикуются на портале GBIF как отдельные датасеты.
#datacatalogs #datasets #russia #opendata #biology
Создан в Югорском государственном университете вначале на грант Евросоюза и далее за счет Президентского гранта. Работает на базе ПО Specify платформе с открытым кодом для собственного или облачного хостинга. В мире не меньше десятка отдельных инсталляций этого продукта и несколько десятков участвующих организаций.
А также эти данные публикуются на портале GBIF как отдельные датасеты.
#datacatalogs #datasets #russia #opendata #biology
🔥6✍3👍3