Сравнение

Web scraping собирает страницы. Enrichment создаёт product record.

Web scraping и product-data enrichment могут работать с внешними источниками, но это разные задачи. Scraping извлекает content со страниц. Enrichment определяет, к какому товару относится информация, превращает useful facts в target schema и проверяет получившуюся record.

ENRIVAQ идёт дальше structured extraction: после validation та же карточка может стать основой SEO keyword targets, unique product content, meta title, meta description и localized product-page output.

Scraping может быть входом в enrichment. Он не является всем enrichment workflow.

PAGE CAPTURE / KNOWLEDGE FORGECOLLECTION ≠ PRODUCT RECORD
SCRAPING

Retrieved page fragments

<h1>Product title
<td>47 mm
<span>0.2 kg
<table>Specification rows
Judgment layerIDENTIFY · MAP · VALIDATE
ENRICHMENT

Usable product record

identityMATCHED
outer_diameter47 mm
weight0.2 kg
schemaMAPPED
validationCHECKED
The difference is everything that happens after the page is retrieved.ONE CAN FEED THE OTHER
Определения

Один подход получает content, другой формирует product record

Обе категории касаются внешних источников. То, что они передают обратно в каталог, отличается.

WEB SCRAPING DEFINITION

Scraping - это шаг сбора данных

На уровне категории scraping означает получение text, tables или fields с web pages для дальнейшей обработки.

Approved source не описывает конкретную crawler architecture ENRIVAQ. Поэтому comparison остаётся концептуальным.

HTMLTEXTTABLES
SAME
ИСТОЧНИК
WORLD
ENRICHMENT / СОЗДАНИЕ RECORD

Обогащение превращает исходную информацию в полезную запись продукта

Обогащение добавляет идентификацию продукта, релевантность источника, структурированное извлечение, нормализацию и валидацию вокруг собранной информации.

Его выход предназначен для рабочего процесса данных о продукте, а не для необработанного слива страниц.

ИДЕНТИФИКАЦИЯХАРАКТЕРИСТИКИЕДИНИЦЫСТАТУС
HTML vs знание продукта

Полученный HTML ещё не означает product knowledge

Страница может содержать значение, но рабочий процесс все равно должен знать, описывает ли страница правильный продукт, вариант или модель.

Именно контекст отличает простой сбор данных от надёжной product record.

Открытие источника
CONTEXT MICROSCOPEVALUE PRESENT · CONTEXT UNKNOWN
RETRIEVED HTML
041<h1>Bearing 6204</h1>
052<td>Outer diameter</td>
053<td>47 mm</td>
061<span>Suitable for...</span>

Questions still open

Is this the correct product?UNKNOWN
Correct model / variant?UNKNOWN
Does 47 mm map to the target attribute?UNKNOWN
Can the value be published?UNKNOWN
Until those questions are answered, the value is a string on a page, not a product fact.
Идентификация продукции

Сначала подтвердите товар — потом доверяйте source

Идентификаторы, контекст производителя и существующие атрибуты могут использоваться для определения релевантности источника-кандидата.

IDENTIFIERSKU / MPN
MANUFACTURERBrand context
EXISTING ATTRIBUTESKnown product signals
MATCH RESULTProduct fingerprint
RELEVANCE CHECK

Match before extract

identifier_matchYES
manufacturer_matchYES
attribute_contextCONSISTENT
source_relevanceACCEPTED
Без идентификации товара данные, извлечённые со страницы похожего, но другого товара, могут выглядеть правдоподобно и при этом быть неверными.Такая ошибка незаметна: формат и единица верны, но значение относится к другому товару.Извлечение атрибутов
Нормализация

Переводите source values на язык target catalog

Внешние страницы могут использовать разные названия характеристик, единицы и форматы. Enrichment сопоставляет значения с целевой схемой, а не переносит формат каждого источника как есть.

SCHEMA TRANSLATION LOOMSOURCE → CANONICAL
Source page saysCatalog expectsMapping
Outer ØOuter diameterNAME MAP
4.7 cm47 mmUNIT NORMALIZE
Weight 200 g0.2 kgUNIT NORMALIZE
Material: steelSteelVALUE STANDARDIZE
Illustrative mapping only. Real mappings are defined against the target schema of the catalog.Product data standardization →TARGET SCHEMA DRIVES OUTPUT
CONFLICT TRIBUNALONE ATTRIBUTE · THREE SOURCES
SOURCE A47 mmManufacturer page
SOURCE B46.8 mmDistributor page
SOURCE C48 mmMarketplace listing
DECISIONValidate
RESOLUTION STATE

Conflict stays open until resolved

candidate47 mm
confidenceREVIEW
publishBLOCKED
Another crawl adds a fourth number. It does not decide which one is right.
валидация

Конфликт требует решения, а не ещё одного scrape

Если два источника не согласны, сбор большего количества HTML не решает проблему автоматически.

Именно поэтому конфликты источников рассматриваются как отдельный этап в рабочем процессе данных о продукте.

Проверка данных о продукте
Структурированный выход

Каталогу нужны typed fields, а не сохранённая web page

Цепочка заканчивается типизированным значением с единицей и статусом проверки, а не на сохраненной странице.

RAW TOKEN47
RAW TOKENmm
RAW TOKENOuter Ø
RAW TOKENsource URL
RECORD COMPILERType + map + validate
CANONICAL ATTRIBUTE
attributeouter_diameter
value47
unitmm
statusVALIDATED
Канонический атрибут, значение, единица и статус валидации — четыре вещи, на которых может работать каталог.Обогащение данных о продукте AI
Сравнение

Сравнивайте collection и product-data transformation

Обогащение - это последовательность, которая превращает этот шаг в запись.

SCOPE RIBBONWORK COVERAGE
IDENTIFYCOLLECTEXTRACTNORMALIZEVALIDATEOUTPUT
Web scrapingУзкая задача сбора
—
COLLECT
—
—
—
СТРАНИЦА / СЫРЫЕ ДАННЫЕ
Обогащение товарных данныхWorkflow создания product record
IDENTIFY
COLLECT
EXTRACT
NORMALIZE
VALIDATE
RECORD
Скрапинг не представлен как меньший инструмент — только как более узкий.
Архитектура, где scraping может быть входным этапом

Collection может быть одним этапом более широкого enrichment workflow

Сбор источников - это первый этап. Все, что после него делает результат пригодным для использования.

PIPELINE CUTAWAYCOLLECTION IS ONE CHAMBER
01

Collect

Retrieve page content or source material.

02

Identify

Confirm which product the source belongs to.

03

Extract

Turn source material into typed product facts.

04

Normalize

Map names, units and values to the target schema.

05

Validate + output

Resolve uncertainty and return usable product data.

No specific source-collection method is described as an implemented ENRIVAQ feature unless it is verified in the product.CLAIM CONTROL
Следующий шаг

Покажите, какой output на самом деле нужен вашему каталогу

Отправьте целевую схему и один продукт, который определяет, что должно вернуться как поле, а не как страница.

YOU BRINGОдин продуктИзвестные поля + идентификаторы
DIAGNOSTICКонтракт product record
TARGETСхема каталогаПоля, типы, единицы, конечный результат

Связаться с ENRIVAQ

Запросить оценку каталога

Расскажите достаточно о каталоге и задаче, чтобы следующий шаг был действительно полезным.