
اسکرپر محصولات آمازون با BrightData، GPT-4 و Google Sheets
7 دقیقه مطالعه · منتشر شده ۱۴۰۵/۴/۲۷
دانلود workflow
فایل JSON آماده import در n8n — credentialها باید در n8n شما تنظیم شوند.
- فایل JSON را دانلود کنید.
- در n8n: Workflows → Import from File.
- Credentialهای هر node را متصل کنید.
- workflow را فعال کنید.
شناسه workflow: 3901 · منبع: کاتالوگ Axeto
اسکرپر جستجوی محصولات آمازون با BrightData، GPT-4 و Google Sheets
این گردش کار، استخراج دادههای ساختاریافته محصولات را از نتایج جستجوی آمازون خودکار میکند. این گردش کار از BrightData برای وب اسکرپینگ، GPT-4 از طریق OpenRouter برای تجزیه هوشمند دادهها و Google Sheets برای ورودی و خروجی استفاده میکند. این برای تحلیلگران تجارت الکترونیک، محققان بازار و بازاریابان وابسته که نیاز به جمعآوری دادههای محصولات آمازون در مقیاس دارند، ایدهآل است.
این و سایر گردش کارهای قدرتمند را در کاتالوگ n8n در Axeto.ai کاوش کنید.
نمای کلی گردش کار
گردش کار به مراحل کلیدی زیر ساختار یافته است:
1. دریافت ورودی: لیستی از URLهای جستجوی آمازون را از یک Google Sheet میخواند.
2. پردازش دستهای: URLها را برای پردازش متوالی به دستههای قابل مدیریت تقسیم میکند.
3. وب اسکرپینگ: از API Web Unlocker برای BrightData برای دریافت محتوای خام HTML از هر صفحه نتایج جستجوی آمازون استفاده میکند.
4. پاکسازی HTML: HTML خام را پاکسازی کرده و عناصر اضافی را برای جداسازی اطلاعات محصول حذف میکند.
5. استخراج هوش مصنوعی: از یک مدل GPT-4 مبتنی بر LangChain برای تجزیه HTML پاکسازی شده و استخراج دادههای ساختاریافته محصول در قالب JSON استفاده میکند.
6. خروجی داده: دادههای محصول تولید شده توسط هوش مصنوعی را تقسیم کرده و هر رکورد را به عنوان یک ردیف به یک Google Sheet اضافه میکند.
7. جریان کنترل: تا زمانی که کل لیست تکمیل شود، به طور تکراری تمام URLها را پردازش میکند.
جزئیات گرهها
۱. ورودی و دستهبندی
این بخش، بازیابی URLهای هدف و آمادهسازی آنها برای پردازش را مدیریت میکند.
-
When clicking ‘Test workflow’
* نوع: Manual Trigger
* هدف: اجرای گردش کار را به صورت دستی آغاز میکند.
-
get urls to scrape
* نوع: Google Sheets
* هدف: URLهای جستجوی آمازون را از یک Google Sheet مشخص ({{WEB_SHEET_ID}}، شیت {{TRACK_SHEET_GID}}) میخواند. نیاز به احراز هویت Google OAuth2 دارد.
-
url
* نوع: Split In Batches
* هدف: لیست URLها را برای مدیریت بار پردازش و جلوگیری از اتمام زمان، به دستههای کوچکتر و متوالی تقسیم میکند.
۲. وب اسکرپینگ با BrightData
این مرحله، محتوای خام HTML را از صفحات نتایج جستجوی آمازون دریافت میکند.
-
scrap url
* نوع: HTTP Request
* هدف: یک درخواست POST به API Web Unlocker برای BrightData (https://api.brightdata.com/request) ارسال میکند تا HTML خام را برای هر URL دریافت کند.
* پیکربندی:
* URL: https://api.brightdata.com/request
* Method: POST
* Body Parameters:
* zone: "web_unlocker1" (منطقه BrightData)
* url: به صورت پویا به URL فعلی از ورودی تنظیم میشود (={{ $json.url }}).
* format: "raw"
* Headers: نیاز به یک هدر Authorization با توکن BrightData شما ({{BRIGHTDATA_TOKEN}}) دارد.
* نکته: میتوانید از طریق اینجا برای یک دوره آزمایشی رایگان API وب اسکرپر BrightData ثبت نام کنید.
۳. پاکسازی HTML
این گره، HTML اسکرپ شده را با حذف عناصر غیرضروری برای تجزیه هوش مصنوعی آماده میکند.
-
clean html
* نوع: Code (JavaScript)
* هدف: HTML خام را با حذف DOCTYPE، <script>، <style>، <head>، کامنتها و تمام صفات به جز لیست مجاز تعریف شدهای از تگها (h1-h6، p، ul، ol، li، strong، em، a، blockquote، code، pre) پاکسازی میکند. همچنین خطوط خالی را استاندارد کرده و فضای خالی را کوتاه میکند.
۴. استخراج داده با هوش مصنوعی
این بخش از LangChain و GPT-4 برای استخراج دادههای ساختاریافته از HTML پاکسازی شده استفاده میکند.
-
OpenRouter Chat Model
* نوع: LangChain LM Chat OpenRouter
* هدف: مدل GPT-4.1 را از طریق OpenRouter برای پردازش زبان طبیعی پیکربندی میکند. نیاز به کلید API OpenRouter دارد.
-
Structured Output Parser
* نوع: LangChain Output Parser Structured
* هدف: یک طرحواره JSON سختگیرانه را برای خروجی هوش مصنوعی اعمال میکند. طرحواره انتظار یک آرایه از محصولات را دارد که هر کدام دارای name (رشته)، description (رشته)، rating (عدد)، reviews (عدد صحیح) و price (رشته) هستند.
-
extract data
* نوع: LangChain Chain LLM
* هدف: فرآیند استخراج هوش مصنوعی را هماهنگ میکند. یک اعلان (prompt) برای GPT-4 میسازد و به آن دستور میدهد تا اطلاعات محصول را بر اساس HTML پاکسازی شده و عبارت جستجو مشتق شده از URL استخراج کند. سپس از مدل چت و تجزیهکننده خروجی پیکربندی شده برای پردازش پاسخ استفاده میکند.
۵. خروجی داده و حلقهزنی
این مرحله نهایی، دادههای استخراج شده را ذخیره کرده و ادامه گردش کار را مدیریت میکند.
-
Split items
* نوع: Split Out
* هدف: آرایه اشیاء محصول دریافت شده از هوش مصنوعی را به رکوردهای محصول جداگانه تجزیه میکند.
-
add results
* نوع: Google Sheets
* هدف: هر رکورد محصول جداگانه را به عنوان یک ردیف جدید به Google Sheet نتایج ({{WEB_SHEET_ID}}، شیت {{RESULTS_SHEET_GID}}) اضافه میکند. نیاز به احراز هویت Google OAuth2 دارد.
* پیکربندی: فیلدهای استخراج شده (name، price، rating، reviews، description) را به ستونهای مربوطه شیت نگاشت میکند.
- حلقهزنی: خروجی گره
add resultsبه گرهurl(Split In Batches) بازمیگردد و به گردش کار اجازه میدهد تا دسته بعدی URLها را پردازش کند تا زمانی که همه تکمیل شوند.
جدول خلاصه
| نام گره | نوع گره | نقش عملکردی | گره(های) ورودی | گره(های) خروجی | یادداشت چسبنده |
|---|---|---|---|---|---|
When clicking ‘Test workflow’ | Manual Trigger | گردش کار را به صورت دستی شروع میکند | None | get urls to scrape | |
get urls to scrape | Google Sheets | URLها را از Google Sheets میخواند | When clicking ‘Test workflow’ | url | |
url | Split In Batches | لیست URL را به دستهها تقسیم میکند | get urls to scrape, add results | scrap url | |
scrap url | HTTP Request | HTML خام را از طریق API BrightData دریافت میکند | url | clean html | ## API وب اسکرپر ثبت نام - دوره آزمایشی رایگان |
clean html | Code (JavaScript) | HTML خام را برای لیست مجاز تگها پاکسازی میکند | scrap url | extract data | |
OpenRouter Chat Model | LangChain LM Chat OpenRouter | مدل GPT-4 را برای تجزیه فراهم میکند | extract data | extract data | |
Structured Output Parser | LangChain Output Parser Structured | خروجی هوش مصنوعی را به طرحواره JSON تجزیه میکند | extract data | extract data | |
extract data | LangChain Chain LLM | اعلان را ارسال کرده و پاسخ هوش مصنوعی را تجزیه میکند | clean html, OpenRouter Chat Model, Structured Output Parser | Split items | |
Split items | Split Out | آرایه محصول را به موارد جداگانه تقسیم میکند | extract data | add results | |
add results | Google Sheets | دادههای محصول را به شیت نتایج اضافه میکند | Split items | url |
بازسازی گردش کار
برای بازسازی این گردش کار:
1. افزودن گره Manual Trigger: با یک Manual Trigger شروع کنید.
2. ورودی Google Sheets: یک گره Google Sheets برای خواندن لیست URLهای آمازون خود اضافه کنید. آن را با شناسه Google Sheet و GID شیت خود پیکربندی کنید.
3. دستهبندی: یک گره Split In Batches برای مدیریت لیست URL درج کنید.
4. اسکرپینگ BrightData: از یک گره HTTP Request که برای API Web Unlocker BrightData پیکربندی شده است، استفاده کنید. اطمینان حاصل کنید که توکن BrightData شما به عنوان یک اعتبار (credential) تنظیم شده است.
5. پاکسازی HTML: یک گره Code با تابع جاوا اسکریپت ارائه شده برای پاکسازی HTML پیادهسازی کنید.
6. استخراج هوش مصنوعی LangChain:
* یک گره LangChain LM Chat OpenRouter اضافه کنید و آن را با کلید API OpenRouter خود پیکربندی کرده و مدل GPT-4 را انتخاب کنید.
* یک گره LangChain Output Parser Structured اضافه کنید و طرحواره JSON را برای دادههای محصول تعریف کنید.
* یک گره LangChain Chain LLM برای هماهنگ کردن اعلان، مدل و تجزیهکننده اضافه کنید.
7. خروجی داده:
* از یک گره Split Out برای جدا کردن رکوردهای محصول جداگانه استفاده کنید.
* یک گره Google Sheets دیگر برای اضافه کردن دادههای ساختاریافته به شیت نتایج خود اضافه کنید.
8. حلقهزنی: خروجی گره Google Sheets نتایج را به ورودی گره Split In Batches بازگردانید تا اطمینان حاصل شود که تمام URLها پردازش میشوند.
9. اعتبارات: اطمینان حاصل کنید که تمام اعتبارات لازم (Google OAuth2، توکن BrightData، کلید API OpenRouter) در n8n پیکربندی شدهاند.
Nodeهای استفادهشده
سوالات متداول
این گردش کار n8n چه کاری انجام میدهد؟▾
این گردش کار، استخراج خودکار دادههای ساختاریافته محصولات را از نتایج جستجوی آمازون انجام میدهد. از BrightData برای وب اسکرپینگ، GPT-4 برای تجزیه هوشمند دادهها و Google Sheets برای ورودی و خروجی استفاده میکند.
چه ابزارهایی در این گردش کار استفاده شده است؟▾
این گردش کار از ابزارهایی مانند BrightData (برای وب اسکرپینگ)، GPT-4 (از طریق OpenRouter برای تجزیه هوش مصنوعی)، LangChain (برای مدیریت مدل هوش مصنوعی) و Google Sheets (برای ورودی و خروجی دادهها) استفاده میکند.
چگونه میتوانم از این گردش کار استفاده کنم؟▾
برای استفاده از این گردش کار، نیاز به تنظیم کلیدهای API برای BrightData و OpenRouter دارید. همچنین باید یک Google Sheet برای ورودی URLهای جستجوی آمازون و خروجی دادههای استخراج شده پیکربندی کنید.
چه نوع دادههایی را میتوانم از آمازون استخراج کنم؟▾
این گردش کار برای استخراج دادههای مربوط به محصولات در نتایج جستجوی آمازون طراحی شده است. GPT-4 میتواند اطلاعات ساختاریافتهای مانند عنوان محصول، قیمت، رتبه، توضیحات و غیره را از HTML پاکسازی شده استخراج کند.
workflowهای مرتبط
- اتوماسیون جستجوی لینکدین با GPT-4 و جستجوی بولی گوگلHR
- اتوماسیون خلاصهسازی جلسات با Google Drive و OpenAIAI
- تحلیل صوتی با DeepGram و GPT-4o در n8nAI
- گردش کار n8n: ارجاع پشتیبانی هوش مصنوعی به انسانSupport
- ناشناسسازی و بازسازی رزومه با هوش مصنوعی Gemini و Google Sh…HR
- پرسش از هوش مصنوعی درباره تبلیغات متا: بینش فوری از دادههای…AI
