Web scraping собирает страницы. Enrichment создаёт product record.
Web scraping и product-data enrichment могут работать с внешними источниками, но это разные задачи. Scraping извлекает content со страниц. Enrichment определяет, к какому товару относится информация, превращает useful facts в target schema и проверяет получившуюся record.
ENRIVAQ идёт дальше structured extraction: после validation та же карточка может стать основой SEO keyword targets, unique product content, meta title, meta description и localized product-page output.
Scraping может быть входом в enrichment. Он не является всем enrichment workflow.
Retrieved page fragments
<h1>Product title<td>47 mm<span>0.2 kg<table>Specification rowsUsable product record
identityMATCHEDouter_diameter47 mmweight0.2 kgschemaMAPPEDvalidationCHECKEDONE CAN FEED THE OTHERОдин подход получает content, другой формирует product record
Обе категории касаются внешних источников. То, что они передают обратно в каталог, отличается.
Scraping - это шаг сбора данных
На уровне категории scraping означает получение text, tables или fields с web pages для дальнейшей обработки.
Approved source не описывает конкретную crawler architecture ENRIVAQ. Поэтому comparison остаётся концептуальным.
ИСТОЧНИК
WORLD
Обогащение превращает исходную информацию в полезную запись продукта
Обогащение добавляет идентификацию продукта, релевантность источника, структурированное извлечение, нормализацию и валидацию вокруг собранной информации.
Его выход предназначен для рабочего процесса данных о продукте, а не для необработанного слива страниц.
Полученный HTML ещё не означает product knowledge
Страница может содержать значение, но рабочий процесс все равно должен знать, описывает ли страница правильный продукт, вариант или модель.
Именно контекст отличает простой сбор данных от надёжной product record.
Открытие источникаQuestions still open
UNKNOWNUNKNOWNUNKNOWNUNKNOWNСначала подтвердите товар — потом доверяйте source
Идентификаторы, контекст производителя и существующие атрибуты могут использоваться для определения релевантности источника-кандидата.
Match before extract
identifier_matchYESmanufacturer_matchYESattribute_contextCONSISTENTsource_relevanceACCEPTEDПереводите source values на язык target catalog
Внешние страницы могут использовать разные названия характеристик, единицы и форматы. Enrichment сопоставляет значения с целевой схемой, а не переносит формат каждого источника как есть.
Outer ØOuter diameterNAME MAP4.7 cm47 mmUNIT NORMALIZEWeight 200 g0.2 kgUNIT NORMALIZEMaterial: steelSteelVALUE STANDARDIZETARGET SCHEMA DRIVES OUTPUTConflict stays open until resolved
candidate47 mmconfidenceREVIEWpublishBLOCKEDКонфликт требует решения, а не ещё одного scrape
Если два источника не согласны, сбор большего количества HTML не решает проблему автоматически.
Именно поэтому конфликты источников рассматриваются как отдельный этап в рабочем процессе данных о продукте.
Проверка данных о продуктеКаталогу нужны typed fields, а не сохранённая web page
Цепочка заканчивается типизированным значением с единицей и статусом проверки, а не на сохраненной странице.
attributeouter_diametervalue47unitmmstatusVALIDATEDСравнивайте collection и product-data transformation
Обогащение - это последовательность, которая превращает этот шаг в запись.
Collection может быть одним этапом более широкого enrichment workflow
Сбор источников - это первый этап. Все, что после него делает результат пригодным для использования.
Collect
Retrieve page content or source material.
Identify
Confirm which product the source belongs to.
Extract
Turn source material into typed product facts.
Normalize
Map names, units and values to the target schema.
Validate + output
Resolve uncertainty and return usable product data.
CLAIM CONTROLПокажите, какой output на самом деле нужен вашему каталогу
Отправьте целевую схему и один продукт, который определяет, что должно вернуться как поле, а не как страница.