Что такое наборы данных ? (1/2)
Есть такой важный вопрос которым я задаюсь в последнее время особенно, который звучит банально, а ответ на него не так прост. А что такое данные? Что такое набор данных/датасет? Есть множество формальных определений, самое базовое это "dataset is a collection of data" , но на практике возникает множество нюансов.
Например, является ли изображение набором данных? Скорее всего нет, например, изображение обложки книги точно не набор данных. А если это карта? Или если это WMS сервис отдающий изображения? По сути - это метаданные + изображение. Он ближе к датасету, по крайней мере из практики использования. А если у нас изображение картины будет вместе с метаданными о нём? Это датасет ? Скорее нет чем да, но можно поспорить. А вот если это будет коллекция из тысяч изображений и метаданные к ним это уже точно набор данных. Возможно даже для машинного обучения. Точно также как и одна аудиозапись - это не набор данных, а тысячи аудиозаписи + метаданные + аннотации вполне себе типичный набор данных для ML.
#data #datasearch #datafragmentation #thoughts
Есть такой важный вопрос которым я задаюсь в последнее время особенно, который звучит банально, а ответ на него не так прост. А что такое данные? Что такое набор данных/датасет? Есть множество формальных определений, самое базовое это "dataset is a collection of data" , но на практике возникает множество нюансов.
Например, является ли изображение набором данных? Скорее всего нет, например, изображение обложки книги точно не набор данных. А если это карта? Или если это WMS сервис отдающий изображения? По сути - это метаданные + изображение. Он ближе к датасету, по крайней мере из практики использования. А если у нас изображение картины будет вместе с метаданными о нём? Это датасет ? Скорее нет чем да, но можно поспорить. А вот если это будет коллекция из тысяч изображений и метаданные к ним это уже точно набор данных. Возможно даже для машинного обучения. Точно также как и одна аудиозапись - это не набор данных, а тысячи аудиозаписи + метаданные + аннотации вполне себе типичный набор данных для ML.
#data #datasearch #datafragmentation #thoughts