Добавлю ещё некоторое количество рефлексии по использовании LLM и ИИ агентов для создания базы знаний.
1. После некоторого числа экспериментов действительно Kimi K3 можно сравнить с последними моделями OpenAI и Anthropic. Созданные ей карточки в базе знаний куда более полные чем, к примеру, созданные с помощью GLM-5.2 или моделями попроще. Это важно поскольку существенно удешевляет процесс.
2. По наблюдениям наиболее эффективен двухэтапный процесс с human-in-the-loop. Вначале делать промпт на создание промпта, далее, делать его ревью и редактировать, при необходимости. и следующим шагом уже полученный промпт отдавать LLM. Первый этап можно делать и моделью попроще вроде той же GLM-5.2, а второй куда лучше отрабатывает уже более продвинутая модель. По сути это путь двухэтапного анализа поскольку при формировании комплексного промпта модель делает предварительный анализ объекта документирования.
3. Главный недостаток такого подхода в том что он существенно удлиняет процесс подготовки базы знаний, примерно в 2-3 раза и дублирует многие шаги потому что и, на предварительном анализа, и на финальном, идёт обращение к одним и тем же объектам. Например, если на вход поступает какой-то раздел сайта с набором тематических документов, то они скачиваются дважды. Может быть на стадии подготовки промпта не все, но тем не менее когда качество результата важнее скорости это лучший подход.
4. Что хорошо - это работает с любыми цифровыми объектами. Сайтами, датасетами, документами и коллекциями документов, API, текстами в иной форме, базами данных и так далее. Например, если бы я хотел не просто собрать базу данных межгосударственных организаций, но и сделать базу знаний по ним, то я сейчас вполне понимаю как это можно организовать структурно и технически. (оговорюсь - планов создавать такую базу знаний у меня пока нет).
#thoughts #ai #documentation
1. После некоторого числа экспериментов действительно Kimi K3 можно сравнить с последними моделями OpenAI и Anthropic. Созданные ей карточки в базе знаний куда более полные чем, к примеру, созданные с помощью GLM-5.2 или моделями попроще. Это важно поскольку существенно удешевляет процесс.
2. По наблюдениям наиболее эффективен двухэтапный процесс с human-in-the-loop. Вначале делать промпт на создание промпта, далее, делать его ревью и редактировать, при необходимости. и следующим шагом уже полученный промпт отдавать LLM. Первый этап можно делать и моделью попроще вроде той же GLM-5.2, а второй куда лучше отрабатывает уже более продвинутая модель. По сути это путь двухэтапного анализа поскольку при формировании комплексного промпта модель делает предварительный анализ объекта документирования.
3. Главный недостаток такого подхода в том что он существенно удлиняет процесс подготовки базы знаний, примерно в 2-3 раза и дублирует многие шаги потому что и, на предварительном анализа, и на финальном, идёт обращение к одним и тем же объектам. Например, если на вход поступает какой-то раздел сайта с набором тематических документов, то они скачиваются дважды. Может быть на стадии подготовки промпта не все, но тем не менее когда качество результата важнее скорости это лучший подход.
4. Что хорошо - это работает с любыми цифровыми объектами. Сайтами, датасетами, документами и коллекциями документов, API, текстами в иной форме, базами данных и так далее. Например, если бы я хотел не просто собрать базу данных межгосударственных организаций, но и сделать базу знаний по ним, то я сейчас вполне понимаю как это можно организовать структурно и технически. (оговорюсь - планов создавать такую базу знаний у меня пока нет).
#thoughts #ai #documentation
👍5🤔3✍2
Pax Silica vs WAICO
Читаю про WAICO свежесозданный альянс по кооперации 29 стран по поводу ИИ где участвует и Россия все страны Центрально Азии кроме Туркменистана, и многие другие развивающиеся страны Глобального Юга. Ведущая роль там безусловно у Китая и, по сути, это объединение стран вокруг Китая и его глобальной ИИ политики.
И, конечно, невозможно его не противопоставлять инициативе США Pax Silica запущенной в декабре 2025 г. с похожими целями, но еще и с акцентом на редкоземельные металлы и полупроводники, ну и ИИ конечно.
Я оставлю политологам гадать являются ли эти конфигурации инициатив будущими прообразами нового разделения мира на глобальные альянсы.
Пока интересно что пересекаются они только на одной стране - это Казахстан. И что более половины стран мира пока никуда не присоединились.
По тому что я читаю сейчас складывается ощущение что у WAICO есть все шансы охватить почти весь Глобальный Юг, как минимум те страны в которых сильно китайское присутствие.
А вот чего пока нет так это инициатив схожего масштаба от Евросоюза. И это из-за того что ЕС несопоставимы с США и Китаем по развитию технологий ИИ и чуть ли не единственная тема вокруг которой ЕС могут пытаться собрать глобальную инициативу - это ИИ этика, безопасность и другие ограничения. Что сделать будет очень непросто, учитывая приоритет на экономический эффект практически во всех странах.
Правда вот мне совссем непонятно какие бенефиты власти РФ получат от участия в WAICO. Продажа российских ИТ/ИИ продуктов в страны Глобального Юга? Не особо верится. Доступ к китайским вычислительным ресурсам и покупке чипов? Про это интересно было бы узнать подробнее.
А я как раз недавно обновлял и еще планировал обновить карточки страновых блоков в internacia-db и вскоре, может быть даже сегодня, добавлю их туда.
#ai #china #thoughts
Читаю про WAICO свежесозданный альянс по кооперации 29 стран по поводу ИИ где участвует и Россия все страны Центрально Азии кроме Туркменистана, и многие другие развивающиеся страны Глобального Юга. Ведущая роль там безусловно у Китая и, по сути, это объединение стран вокруг Китая и его глобальной ИИ политики.
И, конечно, невозможно его не противопоставлять инициативе США Pax Silica запущенной в декабре 2025 г. с похожими целями, но еще и с акцентом на редкоземельные металлы и полупроводники, ну и ИИ конечно.
Я оставлю политологам гадать являются ли эти конфигурации инициатив будущими прообразами нового разделения мира на глобальные альянсы.
Пока интересно что пересекаются они только на одной стране - это Казахстан. И что более половины стран мира пока никуда не присоединились.
По тому что я читаю сейчас складывается ощущение что у WAICO есть все шансы охватить почти весь Глобальный Юг, как минимум те страны в которых сильно китайское присутствие.
А вот чего пока нет так это инициатив схожего масштаба от Евросоюза. И это из-за того что ЕС несопоставимы с США и Китаем по развитию технологий ИИ и чуть ли не единственная тема вокруг которой ЕС могут пытаться собрать глобальную инициативу - это ИИ этика, безопасность и другие ограничения. Что сделать будет очень непросто, учитывая приоритет на экономический эффект практически во всех странах.
Правда вот мне совссем непонятно какие бенефиты власти РФ получат от участия в WAICO. Продажа российских ИТ/ИИ продуктов в страны Глобального Юга? Не особо верится. Доступ к китайским вычислительным ресурсам и покупке чипов? Про это интересно было бы узнать подробнее.
А я как раз недавно обновлял и еще планировал обновить карточки страновых блоков в internacia-db и вскоре, может быть даже сегодня, добавлю их туда.
#ai #china #thoughts
Wikipedia
Pax Silica
US-led technology and AI supply-chain security initiative
👍5🔥2🤔2🤝2❤1
Множество обновлений в internacia-db дата-продукте с метаданными по всем странам и страновым блокам таким как ЕС, СНГ, НАТО, ЕАЭС, структурам ООН и тысячи других.
Я как-то рассказывал что изучение межгосударственных образований - это мое очень давнее и немного странное хобби, у которого есть практическое применение, в случаях когда надо делать разметку по странам и в случаях когда надо иметь возможность делать аналитику по международным блокам - где они пересекаются, как можно их сравнить и так далее.
В последних нескольких релизах добавлено:
- несколько новых международных блоков таких как Pax Silica, WAICO, WANO, ARABSAT, CDRI, BLASMBL
- обновлены метаданные множества блоков, нескольких сотен. Что-то вручную, что-то с помощью LLM. Много добавлений provenance, подтверждений источников сведений.
- добавлен механизм контроля качества карточек блоков и стран и исправлены многие пробелы в карточках, например, отсутствия перечней стран участников и нормализованные названия стран. Механизм правил такой же как и в реестре Dateno, в виде отдельной команды анализа по набору YAML правил и выдачей результата в виде перечня ошибок в структурированном виде.
- и множество мелких изменений, подробности в CHANGELOG файле
Напомню, что результатом является дата продукт и все в итоге собирается в файлы данных в форматах Parquet, JSONL, YAML и базу данных DuckDB. А сам проект является частью поисковика по датасетам Dateno и используется там для разметки датасетов по странам.
#opendata #datasets #data #opensource
Я как-то рассказывал что изучение межгосударственных образований - это мое очень давнее и немного странное хобби, у которого есть практическое применение, в случаях когда надо делать разметку по странам и в случаях когда надо иметь возможность делать аналитику по международным блокам - где они пересекаются, как можно их сравнить и так далее.
В последних нескольких релизах добавлено:
- несколько новых международных блоков таких как Pax Silica, WAICO, WANO, ARABSAT, CDRI, BLASMBL
- обновлены метаданные множества блоков, нескольких сотен. Что-то вручную, что-то с помощью LLM. Много добавлений provenance, подтверждений источников сведений.
- добавлен механизм контроля качества карточек блоков и стран и исправлены многие пробелы в карточках, например, отсутствия перечней стран участников и нормализованные названия стран. Механизм правил такой же как и в реестре Dateno, в виде отдельной команды анализа по набору YAML правил и выдачей результата в виде перечня ошибок в структурированном виде.
- и множество мелких изменений, подробности в CHANGELOG файле
Напомню, что результатом является дата продукт и все в итоге собирается в файлы данных в форматах Parquet, JSONL, YAML и базу данных DuckDB. А сам проект является частью поисковика по датасетам Dateno и используется там для разметки датасетов по странам.
#opendata #datasets #data #opensource
GitHub
GitHub - datenoio/internacia-db: Public registry of the intergovernmental organizations, country groups and countries. Available…
Public registry of the intergovernmental organizations, country groups and countries. Available as JSONl, Parquet, YAML and DuckDB database datasets - datenoio/internacia-db
👍3🔥3✍2
Подборка ссылок про данные, технологии и не только:
- Ontology Playground opensource веб приложение от Microsoft для визуального исследования онтологий. Выглядит очень хорошо, поддерживает импорт и экспорт RDF/OWL. Делает работу с онтологиями куда более доступной. Интересно откуда такой возвращающийся из небытия интерес к онтологиям? Подозреваю что природа этого в росте интереса подключения ИИ агентов к осмысленному восприятию связей между сущностями. В этом смысле ИИ агенты могут быть не только потребителями, но и инструментами упрощения построения онтологий.
- How We Built Our Knowledge Base о том как Cerebras строят внутреннюю базу знаний. Технических подробностей не очень много, а смысловых и логических немало. Можно обратить внимание на том что базу знаний они строят с прицелом на ускорение онбординга, что логично
- Qwen 3.8 новая модель от Alibaba с 2.4T параметров, позиционируется как сравнимая с Fable 5. Пока не открытая, подписка через QwenCloud начинается с $6. Интересны сравнения с Kimi K3 и ждем открытия модели, конечно
- I burned all my tokens researching how to save tokens автор описывает оркестрацию более слабых моделей как субагентов более продвинутыми на примере исследования темы экономии токенов. И тема интересная, и подход полезно описан.
#opensource #ai #readings #knowledge
- Ontology Playground opensource веб приложение от Microsoft для визуального исследования онтологий. Выглядит очень хорошо, поддерживает импорт и экспорт RDF/OWL. Делает работу с онтологиями куда более доступной. Интересно откуда такой возвращающийся из небытия интерес к онтологиям? Подозреваю что природа этого в росте интереса подключения ИИ агентов к осмысленному восприятию связей между сущностями. В этом смысле ИИ агенты могут быть не только потребителями, но и инструментами упрощения построения онтологий.
- How We Built Our Knowledge Base о том как Cerebras строят внутреннюю базу знаний. Технических подробностей не очень много, а смысловых и логических немало. Можно обратить внимание на том что базу знаний они строят с прицелом на ускорение онбординга, что логично
- Qwen 3.8 новая модель от Alibaba с 2.4T параметров, позиционируется как сравнимая с Fable 5. Пока не открытая, подписка через QwenCloud начинается с $6. Интересны сравнения с Kimi K3 и ждем открытия модели, конечно
- I burned all my tokens researching how to save tokens автор описывает оркестрацию более слабых моделей как субагентов более продвинутыми на примере исследования темы экономии токенов. И тема интересная, и подход полезно описан.
#opensource #ai #readings #knowledge
GitHub
GitHub - microsoft/Ontology-Playground: Free, open-source web app for learning about ontologies and Microsoft Fabric IQ. Explore…
Free, open-source web app for learning about ontologies and Microsoft Fabric IQ. Explore a catalogue of pre-built ontologies, design your own visually, export as RDF/XML, and share interactive diag...
👍7
Я тут выложил свежие версии инструментов с открытым кодом для работы с данными iterabledata библиотеки для построчного чтения и записи данных из более чем 140 форматов файлов данных и undatum инструмент швейцарский нож для работы с данными в командной строке которые использует iterabledata для чтения, обработки и преобразования.
В iterabledata добавлено:
- поддержка множества новых форматов геоданных, научных данных и тд. таких как (
- поддержка чтения данных из озер данных и где-то записи таких как Apache Poimon и DuckLake
- поддержка записи данных в DeltaLake и Iceberg
- много изменений для повышения производительности чтения и записи Parquet файлов
- исправление множества ошибок и мелкие правки
В undatum добавлено:
- новая команда repack позволяет переупаковать дата файлы для большего сжатия. Если это формат parquet/orc/avro то использует внутренний кодек, если это файл сжатый Gzip, Bzip2 и тд. то пересжимает его. Нужно, в основном, для ситуаций когда надо пересжать слабо сжатые дата файлы вроде Parquet
- добавлена команда db dump по экспорту таблицы из базы данных сразу в Parquet/CSV/JSONL
- добавлена опция —low-memory для ряда команд для работы с файлами большого размера без чрезмерного использования RAM
- исправлен/модернизирован код генерации API на основе дата файла
- добавление использования DuckDB во многие команды, там где это возможно, для ускорения их работы
- множество мелких изменений и исправлений
#opensource #datatools #dataengineering
В iterabledata добавлено:
- поддержка множества новых форматов геоданных, научных данных и тд. таких как (
fgdb/gdb), MapInfo MIF, Esri ASCII Grid (asc), ArcInfo E00, LAS LiDAR, BAG bathymetry, CZML, XYZ, CIF, PDB, MATLAB MAT, SEG-Y, GRIB2, miniSEED- поддержка чтения данных из озер данных и где-то записи таких как Apache Poimon и DuckLake
- поддержка записи данных в DeltaLake и Iceberg
- много изменений для повышения производительности чтения и записи Parquet файлов
- исправление множества ошибок и мелкие правки
В undatum добавлено:
- новая команда repack позволяет переупаковать дата файлы для большего сжатия. Если это формат parquet/orc/avro то использует внутренний кодек, если это файл сжатый Gzip, Bzip2 и тд. то пересжимает его. Нужно, в основном, для ситуаций когда надо пересжать слабо сжатые дата файлы вроде Parquet
- добавлена команда db dump по экспорту таблицы из базы данных сразу в Parquet/CSV/JSONL
- добавлена опция —low-memory для ряда команд для работы с файлами большого размера без чрезмерного использования RAM
- исправлен/модернизирован код генерации API на основе дата файла
- добавление использования DuckDB во многие команды, там где это возможно, для ускорения их работы
- множество мелких изменений и исправлений
#opensource #datatools #dataengineering
GitHub
GitHub - datenoio/iterabledata: Iterable Data is a Python library for reading and writing data files row by row in a consistent…
Iterable Data is a Python library for reading and writing data files row by row in a consistent, iterator-based interface. It provides a unified API for working with various data formats (CSV, JSON...
✍6❤2👍2
Одно из наблюдаемых мной явлений - это как AI и Data стали почти синонимами и как взлетают по популярности новые инструменты работы с данными и как медленно умирают инструменты периферийные к трендам.
К примеру, OpenRefine довольно старый проект по чистке данных, возможно лучший из тех что открытым кодом уже с марта 2026 года перестал выпускать новые релизы. Разработка в репозитории ведется, но явно гораздо медленнее чем раньше и ничего радикально нового там не появляется.
Проект изначально был устроен так что работа с данными в нем ведется полностью в памяти и после определенных объемов он не справляется. При этом он позволяет вручную или с помощью синтаксисов Python или GREL (специальный язык для манипуляции данными) править данные в строках и колонках сохраняя полную историю изменений с возможностью их отката.
В его текущем движке ускорить его невозможно как и невозможно просто поддержать реально большие наборы данных. В результате области применения остаются только для данных относительно небольшого размера. Поэтому его так часто используют журналисты и он активно используется в разного рода проектах цифровой гуманитаристики. Причем альтернатив ему реально очень мало, в каком-то смысле совсем нет, если нужен интерфейс не программный, а пользовательский.
Интересно выживет ли он вообще? Не бросит ли его команда в какой-то момент?
Я как-то рассуждал тут вслух о том что если делать подобный инструмент современными методами, то движок внутри должен быть на базе DuckDB или Polars. Практически все операции можно делать SQL запросами, а вместо кода на GREL можно использовать text-to-SQL формы запросов совмещая инструмент очистки данных с data exploration.
#opensource #opendata #datatools
К примеру, OpenRefine довольно старый проект по чистке данных, возможно лучший из тех что открытым кодом уже с марта 2026 года перестал выпускать новые релизы. Разработка в репозитории ведется, но явно гораздо медленнее чем раньше и ничего радикально нового там не появляется.
Проект изначально был устроен так что работа с данными в нем ведется полностью в памяти и после определенных объемов он не справляется. При этом он позволяет вручную или с помощью синтаксисов Python или GREL (специальный язык для манипуляции данными) править данные в строках и колонках сохраняя полную историю изменений с возможностью их отката.
В его текущем движке ускорить его невозможно как и невозможно просто поддержать реально большие наборы данных. В результате области применения остаются только для данных относительно небольшого размера. Поэтому его так часто используют журналисты и он активно используется в разного рода проектах цифровой гуманитаристики. Причем альтернатив ему реально очень мало, в каком-то смысле совсем нет, если нужен интерфейс не программный, а пользовательский.
Интересно выживет ли он вообще? Не бросит ли его команда в какой-то момент?
Я как-то рассуждал тут вслух о том что если делать подобный инструмент современными методами, то движок внутри должен быть на базе DuckDB или Polars. Практически все операции можно делать SQL запросами, а вместо кода на GREL можно использовать text-to-SQL формы запросов совмещая инструмент очистки данных с data exploration.
#opensource #opendata #datatools
👍6❤2😢2