تحقیق وب با هوش مصنوعی در Google Sheets با GPT و Bright Data

تحقیق وب با هوش مصنوعی در Google Sheets با GPT و Bright Data

11 دقیقه مطالعه · منتشر شده ۱۴۰۵/۴/۲۷

دانلود workflow

فایل JSON آماده import در n8n — credentialها باید در n8n شما تنظیم شوند.

  1. فایل JSON را دانلود کنید.
  2. در n8n: Workflows → Import from File.
  3. Credentialهای هر node را متصل کنید.
  4. workflow را فعال کنید.

شناسه workflow: 10119 · منبع: کاتالوگ Axeto

تحقیق وب با قدرت هوش مصنوعی در Google Sheets با GPT و Bright Data

این گردش کار تحقیق وب را با ادغام Google Sheets، مدل‌های GPT و قابلیت‌های جمع‌آوری داده از وب در مقیاس سازمانی Bright Data خودکار می‌کند. این به کاربران امکان می‌دهد تا درخواست‌های تحقیق را مستقیماً از Google Sheets از طریق یک وب‌هوک امن آغاز کنند. سپس سیستم پرس‌وجو را اصلاح کرده، جستجوی مبتنی بر هوش مصنوعی را با استفاده از پروکسی‌های Bright Data انجام می‌دهد، محتوای وب مرتبط را جمع‌آوری می‌کند، اطلاعات کلیدی را با استفاده از هوش مصنوعی استخراج و خلاصه می‌کند و در نهایت خلاصه مختصر را به کاربر بازمی‌گرداند و در عین حال تعامل را ثبت می‌کند.

شما می‌توانید این گردش کار و موارد دیگر را در کاتالوگ Axeto بیابید: https://axeto.ai/n8n

نمای کلی گردش کار

این گردش کار به بلوک‌های مجزا تقسیم شده است که هر کدام مسئول مرحله خاصی از فرآیند تحقیق هستند:

1. دریافت ورودی و تنظیم متغیرها: درخواست‌های کاربر را از طریق یک وب‌هوک به طور امن دریافت کرده و متغیرهای گردش کار را مقداردهی اولیه می‌کند.

2. اصلاح پرس‌وجو: از یک عامل هوش مصنوعی برای بهینه‌سازی درخواست کاربر به یک پرس‌وجوی جستجوی دقیق استفاده می‌کند.

3. جستجوی مبتنی بر هوش مصنوعی از طریق Bright Data: از یک عامل هوش مصنوعی برای انجام یک جستجوی هدفمند در گوگل از طریق شبکه پروکسی Bright Data استفاده می‌کند و مرتبط‌ترین صفحه وب را شناسایی می‌کند.

4. جمع‌آوری داده از وب (Web Scraping): محتوای صفحه وب شناسایی شده را با استفاده از API جمع‌آوری داده از وب Bright Data واکشی می‌کند.

5. استخراج و خلاصه‌سازی داده‌ها: محتوای جمع‌آوری شده را با هوش مصنوعی پردازش می‌کند تا اطلاعات مرتبط را استخراج کرده و خلاصه‌ای مختصر تولید کند.

6. پاسخ و ثبت وقایع: اطلاعات خلاصه‌شده را به درخواست‌کننده بازمی‌گرداند و کل تعامل را برای مراجعه در آینده ثبت می‌کند.

---

تحلیل جزئیات بلوک‌ها

۱. دریافت ورودی و تنظیم متغیرها

این بلوک مسئول دریافت اولیه درخواست‌ها و تنظیم متغیرهای لازم برای گردش کار است.

  • نودها:

* Webhook Call (n8n-nodes-base.webhook)

* Set Variables (n8n-nodes-base.set)

* Respond to Webhook (n8n-nodes-base.respondToWebhook)

  • جزئیات نودها:

1. Webhook Call

* نوع: n8n-nodes-base.webhook

* هدف: به عنوان نقطه ورود برای درخواست‌های HTTP POST ورودی عمل می‌کند. این نود برای گوش دادن به مسیر /brightdata-search پیکربندی شده است و نیاز به احراز هویت از طریق یک اعتبارنامه هدر به نام "82Labs - Webhook" دارد. حالت پاسخ به گونه‌ای تنظیم شده است که منتظر پاسخ از نود بعدی بماند.

* ورودی: درخواست‌های خارجی HTTP POST حاوی بدنه JSON با source (دستور کاربر) و prompt (مرجع).

* خروجی: داده‌های JSON از بدنه درخواست.

* ملاحظات: درخواست‌های غیرمجاز، JSON نامعتبر و فیلدهای الزامی گمشده را مدیریت می‌کند.

2. Set Variables

* نوع: n8n-nodes-base.set

* هدف: مقادیر بدنه JSON وب‌هوک را به متغیرهای گردش کار برای دسترسی آسان‌تر در نودهای بعدی اختصاص می‌دهد.

* پیکربندی:

* userPrompt: تنظیم شده به {{$json.body.source}}

* cellReference: تنظیم شده به {{$json.body.prompt}}

* ouputLanguage: به صورت ثابت "Hebrew" تنظیم شده است (قابل تنظیم برای زبان‌های خروجی مختلف).

* ورودی: داده‌ها از نود Webhook Call.

* خروجی: متغیرهای گردش کار.

* ملاحظات: مواردی را که JSON ورودی گمشده یا نامعتبر است، مدیریت می‌کند.

3. Respond to Webhook

* نوع: n8n-nodes-base.respondToWebhook

* هدف: خروجی نهایی خلاصه‌شده را به عنوان یک پاسخ HTTP متنی ساده به درخواست‌کننده اصلی ارسال می‌کند.

* پیکربندی:

* Response Header: Content-Type تنظیم شده به text/plain; charset=utf-8.

* Response Body: تنظیم شده به {{$json.output.summary}} (متن نهایی خلاصه‌شده).

* ورودی: داده‌های خلاصه‌شده از نود Summarize Information.

* ملاحظات: فیلدهای خلاصه گمشده و احتمالاً خطاهای زمانی پاسخ را مدیریت می‌کند.

۲. اصلاح پرس‌وجو

این بلوک بر تبدیل درخواست اولیه کاربر به یک پرس‌وجوی جستجوی بسیار مؤثر تمرکز دارد.

  • نودها:

* Adjust Query Agent (@n8n/n8n-nodes-langchain.agent)

* GPT 4.1 Mini - 1 (@n8n/n8n-nodes-langchain.lmChatOpenAi)

  • جزئیات نودها:

1. Adjust Query Agent

* نوع: @n8n/n8n-nodes-langchain.agent

* هدف: یک عامل هوش مصنوعی که دستور کاربر و مرجع را برای طبقه‌بندی نوع پرس‌وجو (مانند اخبار، مالی، واقعی) و ساخت یک پرس‌وجوی جستجوی بهینه گوگل تجزیه و تحلیل می‌کند.

* پیکربندی:

* Input Text: متغیرهای userPrompt و cellReference را ترکیب می‌کند.

* System Message: حاوی دستورالعمل‌های دقیق برای طبقه‌بندی پرس‌وجو و قوانین ساخت (مانند استفاده از گیومه، بازه‌های زمانی، کلمات کلیدی خاص).

* ورودی: متغیرها از نود Set Variables.

* خروجی: یک رشته پرس‌وجوی جستجوی اصلاح‌شده.

* ملاحظات: پرس‌وجوهای مبهم، ظرافت‌های زبانی و طبقه‌بندی اشتباه احتمالی را مدیریت می‌کند.

* نسخه: نود عامل Langchain نسخه ۲.۲.

2. GPT 4.1 Mini - 1

* نوع: @n8n/n8n-nodes-langchain.lmChatOpenAi

* هدف: مدل زبانی که عامل Adjust Query Agent را تغذیه می‌کند و مسئول درک زبان طبیعی و تولید پرس‌وجو است.

* پیکربندی:

* Model: GPT-4.1 Mini

* Credentials: نیاز به کلید API OpenAI دارد (به عنوان "General - OpenAi" پیکربندی شده است).

* ورودی: داخلی به عامل Adjust Query Agent.

* خروجی: متن پرس‌وجوی اصلاح‌شده.

* ملاحظات: مشمول محدودیت‌های نرخ API OpenAI و خطاهای احتمالی شبکه است.

۳. جستجوی مبتنی بر هوش مصنوعی از طریق Bright Data

این بلوک پرس‌وجوی اصلاح‌شده را با استفاده از یک عامل هوش مصنوعی و خدمات Bright Data برای یافتن یک لینک وب مرتبط اجرا می‌کند.

  • نودها:

* Bright Data MCP (@n8n/n8n-nodes-langchain.mcpClientTool)

* Bright Data Search Agent (@n8n/n8n-nodes-langchain.agent)

* Structured Output Parser - 1 (@n8n/n8n-nodes-langchain.outputParserStructured)

* GPT 4o - 1 (@n8n/n8n-nodes-langchain.lmChatOpenAi)

  • جزئیات نودها:

1. Bright Data MCP

* نوع: @n8n/n8n-nodes-langchain.mcpClientTool

* هدف: به پلتفرم مشتری مدیریت‌شده (MCP) Bright Data متصل می‌شود تا از قابلیت‌های جستجوی مجهز به پروکسی آن استفاده کند.

* پیکربندی:

* Endpoint URL: شامل یک توکن احراز هویت جاسازی شده است.

* Tools: فقط برای استفاده از ابزار search_engine پیکربندی شده است.

* Timeout: روی ۱۲۰ ثانیه تنظیم شده است.

* Server Transport: HTTP streamable.

* ورودی: به عنوان یک ابزار توسط عامل Bright Data Search Agent استفاده می‌شود.

* خروجی: نتایج جستجو از Bright Data.

* ملاحظات: نیاز به توکن معتبر Bright Data دارد، مستعد انقضای توکن، مشکلات شبکه یا خرابی سرویس MCP است.

2. Bright Data Search Agent

* نوع: @n8n/n8n-nodes-langchain.agent

* هدف: یک عامل هوش مصنوعی که به طور خاص برای جستجوی وب و بازیابی نتایج طراحی شده است. این عامل پرس‌وجوی اصلاح‌شده را دریافت می‌کند، جستجوی گوگل را انجام می‌دهد (محدود به ۱۰ نتیجه)، منابع قابل اعتماد را اولویت‌بندی می‌کند، تبلیغات و لینک‌های نامربوط را فیلتر می‌کند و بهترین URL را برمی‌گرداند.

* پیکربندی:

* Input: رشته پرس‌وجوی اصلاح‌شده را دریافت می‌کند.

* Output: یک شیء JSON حاوی فیلد "link" با بهترین URL، یا یک رشته خالی در صورت عدم یافتن لینک مناسب. شامل دستورالعمل‌هایی برای مدیریت خطا و اعتبارسنجی نتایج است.

* Model: از GPT-4o برای استدلال داخلی خود استفاده می‌کند.

* ورودی: پرس‌وجوی اصلاح‌شده از عامل Adjust Query Agent.

* خروجی: شیء JSON با بهترین لینک جستجو.

* ملاحظات: سناریوهایی را که هیچ نتیجه‌ای یافت نمی‌شود، خروجی JSON نامعتبر یا خرابی جستجو را مدیریت می‌کند.

3. Structured Output Parser - 1

* نوع: @n8n/n8n-nodes-langchain.outputParserStructured

* هدف: خروجی ساختاریافته JSON (به طور خاص فیلد link) را از عامل Bright Data Search Agent اعتبارسنجی و استخراج می‌کند.

* پیکربندی: انتظار یک طرحواره JSON مانند { "link": "" } را دارد.

* ورودی: خروجی از عامل Bright Data Search Agent.

* خروجی: JSON اعتبارسنجی شده حاوی لینک استخراج شده.

* ملاحظات: JSON نامعتبر یا فیلد لینک خالی را مدیریت می‌کند.

4. GPT 4o - 1

* نوع: @n8n/n8n-nodes-langchain.lmChatOpenAi

* هدف: مدل زبانی که به طور داخلی توسط عامل Bright Data Search Agent برای تصمیم‌گیری در مورد نتایج جستجو و فیلتر کردن استفاده می‌شود.

* پیکربندی:

* Model: GPT-4o

* Credentials: نیاز به کلید API OpenAI دارد.

* ورودی: داخلی به عامل Bright Data Search Agent.

* خروجی: منطق تصمیم‌گیری جستجو.

۴. جمع‌آوری داده از وب لینک هدف

این بلوک محتوای صفحه وب شناسایی شده در مرحله قبل را بازیابی می‌کند.

  • نودها:

* Bright Data - Data Extraction (n8n-nodes-base.httpRequest)

  • جزئیات نودها:

1. Bright Data - Data Extraction

* نوع: n8n-nodes-base.httpRequest

* هدف: یک درخواست POST احراز هویت شده به API Bright Data برای جمع‌آوری داده از URL هدف ارسال می‌کند. از پروکسی‌های سازمانی برای اطمینان از جمع‌آوری موفق و جلوگیری از شناسایی ربات استفاده می‌کند.

* پیکربندی:

* URL: https://api.brightdata.com/request

* Method: POST

* Headers: Authorization: Bearer YOUR_TOKEN_HERE (جایگزین YOUR_TOKEN_HERE با یک توکن معتبر Bright Data).

* Body Parameters:

* zone: mcp_unlocker

* url: به صورت پویا به {{$json.link}} (از نود قبلی) تنظیم شده است.

* format: json

* method: GET

* country: il (اسرائیل - قابل تغییر).

* data_format: markdown (برای تجزیه آسان‌تر).

* Batching: با فاصله ۱ درخواست در هر ۲ ثانیه فعال شده است.

* ورودی: لینک اعتبارسنجی شده از Structured Output Parser - 1.

* خروجی: محتوای صفحه وب جمع‌آوری شده در فرمت JSON، شامل محتوای markdown.

* ملاحظات: نیاز به توکن معتبر API Bright Data دارد. مشکلات احتمالی شامل توکن‌های نامعتبر/منقضی شده، محدودیت نرخ، URLهای شکسته، خطاهای زمانی درخواست و خرابی جمع‌آوری داده است.

۵. استخراج و خلاصه‌سازی داده‌ها

این بلوک محتوای جمع‌آوری شده را پردازش می‌کند تا اطلاعات مرتبط را استخراج کرده و یک خلاصه مختصر تولید کند.

  • نودها:

* Extract Data (@n8n/n8n-nodes-langchain.chainLlm)

* Structured Output Parser - 2 (@n8n/n8n-nodes-langchain.outputParserStructured)

* Summarize Information (@n8n/n8n-nodes-langchain.agent)

* Structured Output Parser - 3 (@n8n/n8n-nodes-langchain.outputParserStructured)

* GPT 4o Mini - 1 (@n8n/n8n-nodes-langchain.lmChatOpenAi)

* GPT 4o Mini - 2 (@n8n/n8n-nodes-langchain.lmChatOpenAi)

  • جزئیات نودها:

1. Extract Data

* نوع: @n8n/n8n-nodes-langchain.chainLlm

* هدف: یک زنجیره هوش مصنوعی که برای استخراج و خلاصه‌سازی اطلاعات مرتبط با پرس‌وجوی اصلی کاربر از محتوای وب جمع‌آوری شده طراحی شده است.

* پیکربندی:

* Input: شامل درخواست اصلی کاربر (userPrompt + cellReference) و محتوای کامل جمع‌آوری شده است.

* Instructions: بر بازگرداندن فقط JSON معتبر با فیلد summary (حداکثر ۴۰۰ کاراکتر) تأکید می‌کند، بر ارتباط تمرکز دارد و در صورت لزوم ترجمه را انجام می‌دهد. شامل دستوری برای مدیریت خطا برای ادامه با خروجی عادی است.

* Models: از GPT 4o Mini - 1 و GPT 4o Mini - 2 برای استخراج و خلاصه‌سازی استفاده می‌کند.

* ورودی: محتوای جمع‌آوری شده از نود Bright Data - Data Extraction.

* خروجی: شیء JSON حاوی خلاصه استخراج شده.

* ملاحظات: محتوای جزئی یا خراب، موضوعات نامرتبط متعدد یا محتوا به زبان‌های مختلف را مدیریت می‌کند.

2. Structured Output Parser - 2

* نوع: @n8n/n8n-nodes-langchain.outputParserStructured

* هدف: خلاصه JSON تولید شده توسط نود Extract Data را اعتبارسنجی و استخراج می‌کند.

* پیکربندی: انتظار یک طرحواره JSON مانند { "summary": "" } را دارد.

* ورودی: خروجی از نود Extract Data.

* خروجی: JSON اعتبارسنجی شده حاوی خلاصه.

* ملاحظات: JSON نامعتبر یا فیلد خلاصه خالی را مدیریت می‌کند.

3. Summarize Information

* نوع: @n8n/n8n-nodes-langchain.agent

* هدف: خلاصه استخراج شده را بیشتر اصلاح و فشرده می‌کند تا یک نتیجه‌گیری نهایی به زبان خروجی ترجیحی کاربر تولید کند.

* پیکربندی:

* System Message: به هوش مصنوعی دستور می‌دهد تا یک نتیجه‌گیری به زبان مشخص شده (از متغیر ouputLanguage)، محدود به ۴۰۰ کاراکتر، تولید کند و فقط JSON معتبر بدون متن اضافی خروجی دهد.

* Input Text: شامل خلاصه استخراج شده و پرس‌وجوی اصلی کاربر است.

* Model: از GPT 4o Mini - 2 استفاده می‌کند.

* ورودی: خلاصه از نود Extract Data.

* خروجی: خلاصه نهایی در فرمت JSON.

* ملاحظات: مشکلات احتمالی ترجمه زبان یا خطاهای API را مدیریت می‌کند.

4. Structured Output Parser - 3

* نوع: @n8n/n8n-nodes-langchain.outputParserStructured

* هدف: ساختار خروجی خلاصه نهایی را از نود Summarize Information قبل از ارسال مجدد به کاربر و ثبت، اعتبارسنجی می‌کند.

* پیکربندی: شامل یک طرحواره JSON نمونه برای اعتبارسنجی است.

* ورودی: خروجی از نود Summarize Information.

* خروجی: JSON اعتبارسنجی شده حاوی خلاصه نهایی.

۶. پاسخ و ثبت وقایع

این بلوک نهایی نتایج را به کاربر تحویل داده و تعامل را ثبت می‌کند.

  • نودها:

* Respond to Webhook (n8n-nodes-base.respondToWebhook)

* Update Logs (n8n-nodes-base.dataTable)

  • جزئیات نودها:

1. Respond to Webhook

* نوع: n8n-nodes-base.respondToWebhook

* هدف: همانطور که در بلوک ۱ توضیح داده شد، این نود خلاصه نهایی را به درخواست‌کننده ارسال می‌کند.

* ورودی: خلاصه نهایی اعتبارسنجی شده از Structured Output Parser - 3.

2. Update Logs

* نوع: n8n-nodes-base.dataTable

* هدف: دستور اصلی کاربر و خلاصه تولید شده توسط هوش مصنوعی را در یک جدول داده به نام "BrightDataLogs" برای پیگیری و تجزیه و تحلیل تاریخی ثبت می‌کند.

* ورودی: دستور کاربر و خلاصه نهایی.

* خروجی: یک ورودی در جدول داده "BrightDataLogs".

Nodeهای استفاده‌شده

سوالات متداول

این گردش کار چگونه تحقیق وب را خودکار می‌کند؟

این گردش کار با دریافت درخواست‌ها از Google Sheets از طریق وب‌هوک، اصلاح پرس‌وجو با هوش مصنوعی، جمع‌آوری محتوای وب با Bright Data و سپس خلاصه‌سازی اطلاعات با GPT، فرآیند تحقیق وب را خودکار می‌کند.

چه ابزارهایی در این گردش کار استفاده شده‌اند؟

این گردش کار از n8n به عنوان پلتفرم اتوماسیون، Google Sheets برای ورودی و خروجی، مدل‌های GPT برای پردازش زبان طبیعی و Bright Data برای جمع‌آوری داده از وب در مقیاس استفاده می‌کند.

چگونه می‌توانم این گردش کار را شروع کنم؟

شما می‌توانید این گردش کار را از کاتالوگ Axeto در آدرس https://axeto.ai/n8n پیدا کرده و آن را برای نیازهای خود پیکربندی و اجرا کنید.

workflowهای مرتبط

این workflow در کاتالوگ Axeto.ai بایگانی شده است. لایسنس اصلی متعلق به سازنده workflow است.