اسکرپر محصولات آمازون با BrightData، GPT-4 و Google Sheets

اسکرپر محصولات آمازون با BrightData، GPT-4 و Google Sheets

7 دقیقه مطالعه · منتشر شده ۱۴۰۵/۴/۲۷

دانلود workflow

فایل JSON آماده import در n8n — credentialها باید در n8n شما تنظیم شوند.

  1. فایل JSON را دانلود کنید.
  2. در n8n: Workflows → Import from File.
  3. Credentialهای هر node را متصل کنید.
  4. workflow را فعال کنید.

شناسه workflow: 3901 · منبع: کاتالوگ Axeto

اسکرپر جستجوی محصولات آمازون با BrightData، GPT-4 و Google Sheets

این گردش کار، استخراج داده‌های ساختاریافته محصولات را از نتایج جستجوی آمازون خودکار می‌کند. این گردش کار از BrightData برای وب اسکرپینگ، GPT-4 از طریق OpenRouter برای تجزیه هوشمند داده‌ها و Google Sheets برای ورودی و خروجی استفاده می‌کند. این برای تحلیلگران تجارت الکترونیک، محققان بازار و بازاریابان وابسته که نیاز به جمع‌آوری داده‌های محصولات آمازون در مقیاس دارند، ایده‌آل است.

این و سایر گردش کارهای قدرتمند را در کاتالوگ n8n در Axeto.ai کاوش کنید.

نمای کلی گردش کار

گردش کار به مراحل کلیدی زیر ساختار یافته است:

1. دریافت ورودی: لیستی از URLهای جستجوی آمازون را از یک Google Sheet می‌خواند.

2. پردازش دسته‌ای: URLها را برای پردازش متوالی به دسته‌های قابل مدیریت تقسیم می‌کند.

3. وب اسکرپینگ: از API Web Unlocker برای BrightData برای دریافت محتوای خام HTML از هر صفحه نتایج جستجوی آمازون استفاده می‌کند.

4. پاکسازی HTML: HTML خام را پاکسازی کرده و عناصر اضافی را برای جداسازی اطلاعات محصول حذف می‌کند.

5. استخراج هوش مصنوعی: از یک مدل GPT-4 مبتنی بر LangChain برای تجزیه HTML پاکسازی شده و استخراج داده‌های ساختاریافته محصول در قالب JSON استفاده می‌کند.

6. خروجی داده: داده‌های محصول تولید شده توسط هوش مصنوعی را تقسیم کرده و هر رکورد را به عنوان یک ردیف به یک Google Sheet اضافه می‌کند.

7. جریان کنترل: تا زمانی که کل لیست تکمیل شود، به طور تکراری تمام URLها را پردازش می‌کند.

جزئیات گره‌ها

۱. ورودی و دسته‌بندی

این بخش، بازیابی URLهای هدف و آماده‌سازی آن‌ها برای پردازش را مدیریت می‌کند.

  • When clicking ‘Test workflow’

* نوع: Manual Trigger

* هدف: اجرای گردش کار را به صورت دستی آغاز می‌کند.

  • get urls to scrape

* نوع: Google Sheets

* هدف: URLهای جستجوی آمازون را از یک Google Sheet مشخص ({{WEB_SHEET_ID}}، شیت {{TRACK_SHEET_GID}}) می‌خواند. نیاز به احراز هویت Google OAuth2 دارد.

  • url

* نوع: Split In Batches

* هدف: لیست URLها را برای مدیریت بار پردازش و جلوگیری از اتمام زمان، به دسته‌های کوچکتر و متوالی تقسیم می‌کند.

۲. وب اسکرپینگ با BrightData

این مرحله، محتوای خام HTML را از صفحات نتایج جستجوی آمازون دریافت می‌کند.

  • scrap url

* نوع: HTTP Request

* هدف: یک درخواست POST به API Web Unlocker برای BrightData (https://api.brightdata.com/request) ارسال می‌کند تا HTML خام را برای هر URL دریافت کند.

* پیکربندی:

* URL: https://api.brightdata.com/request

* Method: POST

* Body Parameters:

* zone: "web_unlocker1" (منطقه BrightData)

* url: به صورت پویا به URL فعلی از ورودی تنظیم می‌شود (={{ $json.url }}).

* format: "raw"

* Headers: نیاز به یک هدر Authorization با توکن BrightData شما ({{BRIGHTDATA_TOKEN}}) دارد.

* نکته: می‌توانید از طریق اینجا برای یک دوره آزمایشی رایگان API وب اسکرپر BrightData ثبت نام کنید.

۳. پاکسازی HTML

این گره، HTML اسکرپ شده را با حذف عناصر غیرضروری برای تجزیه هوش مصنوعی آماده می‌کند.

  • clean html

* نوع: Code (JavaScript)

* هدف: HTML خام را با حذف DOCTYPE، <script>، <style>، <head>، کامنت‌ها و تمام صفات به جز لیست مجاز تعریف شده‌ای از تگ‌ها (h1-h6، p، ul، ol، li، strong، em، a، blockquote، code، pre) پاکسازی می‌کند. همچنین خطوط خالی را استاندارد کرده و فضای خالی را کوتاه می‌کند.

۴. استخراج داده با هوش مصنوعی

این بخش از LangChain و GPT-4 برای استخراج داده‌های ساختاریافته از HTML پاکسازی شده استفاده می‌کند.

  • OpenRouter Chat Model

* نوع: LangChain LM Chat OpenRouter

* هدف: مدل GPT-4.1 را از طریق OpenRouter برای پردازش زبان طبیعی پیکربندی می‌کند. نیاز به کلید API OpenRouter دارد.

  • Structured Output Parser

* نوع: LangChain Output Parser Structured

* هدف: یک طرحواره JSON سختگیرانه را برای خروجی هوش مصنوعی اعمال می‌کند. طرحواره انتظار یک آرایه از محصولات را دارد که هر کدام دارای name (رشته)، description (رشته)، rating (عدد)، reviews (عدد صحیح) و price (رشته) هستند.

  • extract data

* نوع: LangChain Chain LLM

* هدف: فرآیند استخراج هوش مصنوعی را هماهنگ می‌کند. یک اعلان (prompt) برای GPT-4 می‌سازد و به آن دستور می‌دهد تا اطلاعات محصول را بر اساس HTML پاکسازی شده و عبارت جستجو مشتق شده از URL استخراج کند. سپس از مدل چت و تجزیه‌کننده خروجی پیکربندی شده برای پردازش پاسخ استفاده می‌کند.

۵. خروجی داده و حلقه‌زنی

این مرحله نهایی، داده‌های استخراج شده را ذخیره کرده و ادامه گردش کار را مدیریت می‌کند.

  • Split items

* نوع: Split Out

* هدف: آرایه اشیاء محصول دریافت شده از هوش مصنوعی را به رکوردهای محصول جداگانه تجزیه می‌کند.

  • add results

* نوع: Google Sheets

* هدف: هر رکورد محصول جداگانه را به عنوان یک ردیف جدید به Google Sheet نتایج ({{WEB_SHEET_ID}}، شیت {{RESULTS_SHEET_GID}}) اضافه می‌کند. نیاز به احراز هویت Google OAuth2 دارد.

* پیکربندی: فیلدهای استخراج شده (name، price، rating، reviews، description) را به ستون‌های مربوطه شیت نگاشت می‌کند.

  • حلقه‌زنی: خروجی گره add results به گره url (Split In Batches) بازمی‌گردد و به گردش کار اجازه می‌دهد تا دسته بعدی URLها را پردازش کند تا زمانی که همه تکمیل شوند.

جدول خلاصه

نام گرهنوع گرهنقش عملکردیگره(های) ورودیگره(های) خروجییادداشت چسبنده
When clicking ‘Test workflow’Manual Triggerگردش کار را به صورت دستی شروع می‌کندNoneget urls to scrape
get urls to scrapeGoogle SheetsURLها را از Google Sheets می‌خواندWhen clicking ‘Test workflow’url
urlSplit In Batchesلیست URL را به دسته‌ها تقسیم می‌کندget urls to scrape, add resultsscrap url
scrap urlHTTP RequestHTML خام را از طریق API BrightData دریافت می‌کندurlclean html## API وب اسکرپر ثبت نام - دوره آزمایشی رایگان
clean htmlCode (JavaScript)HTML خام را برای لیست مجاز تگ‌ها پاکسازی می‌کندscrap urlextract data
OpenRouter Chat ModelLangChain LM Chat OpenRouterمدل GPT-4 را برای تجزیه فراهم می‌کندextract dataextract data
Structured Output ParserLangChain Output Parser Structuredخروجی هوش مصنوعی را به طرحواره JSON تجزیه می‌کندextract dataextract data
extract dataLangChain Chain LLMاعلان را ارسال کرده و پاسخ هوش مصنوعی را تجزیه می‌کندclean html, OpenRouter Chat Model, Structured Output ParserSplit items
Split itemsSplit Outآرایه محصول را به موارد جداگانه تقسیم می‌کندextract dataadd results
add resultsGoogle Sheetsداده‌های محصول را به شیت نتایج اضافه می‌کندSplit itemsurl

بازسازی گردش کار

برای بازسازی این گردش کار:

1. افزودن گره Manual Trigger: با یک Manual Trigger شروع کنید.

2. ورودی Google Sheets: یک گره Google Sheets برای خواندن لیست URLهای آمازون خود اضافه کنید. آن را با شناسه Google Sheet و GID شیت خود پیکربندی کنید.

3. دسته‌بندی: یک گره Split In Batches برای مدیریت لیست URL درج کنید.

4. اسکرپینگ BrightData: از یک گره HTTP Request که برای API Web Unlocker BrightData پیکربندی شده است، استفاده کنید. اطمینان حاصل کنید که توکن BrightData شما به عنوان یک اعتبار (credential) تنظیم شده است.

5. پاکسازی HTML: یک گره Code با تابع جاوا اسکریپت ارائه شده برای پاکسازی HTML پیاده‌سازی کنید.

6. استخراج هوش مصنوعی LangChain:

* یک گره LangChain LM Chat OpenRouter اضافه کنید و آن را با کلید API OpenRouter خود پیکربندی کرده و مدل GPT-4 را انتخاب کنید.

* یک گره LangChain Output Parser Structured اضافه کنید و طرحواره JSON را برای داده‌های محصول تعریف کنید.

* یک گره LangChain Chain LLM برای هماهنگ کردن اعلان، مدل و تجزیه‌کننده اضافه کنید.

7. خروجی داده:

* از یک گره Split Out برای جدا کردن رکوردهای محصول جداگانه استفاده کنید.

* یک گره Google Sheets دیگر برای اضافه کردن داده‌های ساختاریافته به شیت نتایج خود اضافه کنید.

8. حلقه‌زنی: خروجی گره Google Sheets نتایج را به ورودی گره Split In Batches بازگردانید تا اطمینان حاصل شود که تمام URLها پردازش می‌شوند.

9. اعتبارات: اطمینان حاصل کنید که تمام اعتبارات لازم (Google OAuth2، توکن BrightData، کلید API OpenRouter) در n8n پیکربندی شده‌اند.

Nodeهای استفاده‌شده

سوالات متداول

این گردش کار n8n چه کاری انجام می‌دهد؟

این گردش کار، استخراج خودکار داده‌های ساختاریافته محصولات را از نتایج جستجوی آمازون انجام می‌دهد. از BrightData برای وب اسکرپینگ، GPT-4 برای تجزیه هوشمند داده‌ها و Google Sheets برای ورودی و خروجی استفاده می‌کند.

چه ابزارهایی در این گردش کار استفاده شده است؟

این گردش کار از ابزارهایی مانند BrightData (برای وب اسکرپینگ)، GPT-4 (از طریق OpenRouter برای تجزیه هوش مصنوعی)، LangChain (برای مدیریت مدل هوش مصنوعی) و Google Sheets (برای ورودی و خروجی داده‌ها) استفاده می‌کند.

چگونه می‌توانم از این گردش کار استفاده کنم؟

برای استفاده از این گردش کار، نیاز به تنظیم کلیدهای API برای BrightData و OpenRouter دارید. همچنین باید یک Google Sheet برای ورودی URLهای جستجوی آمازون و خروجی داده‌های استخراج شده پیکربندی کنید.

چه نوع داده‌هایی را می‌توانم از آمازون استخراج کنم؟

این گردش کار برای استخراج داده‌های مربوط به محصولات در نتایج جستجوی آمازون طراحی شده است. GPT-4 می‌تواند اطلاعات ساختاریافته‌ای مانند عنوان محصول، قیمت، رتبه، توضیحات و غیره را از HTML پاکسازی شده استخراج کند.

workflowهای مرتبط

این workflow در کاتالوگ Axeto.ai بایگانی شده است. لایسنس اصلی متعلق به سازنده workflow است.