تحلیل خودکار مقالات Hugging Face با هوش مصنوعی و Notion

تحلیل خودکار مقالات Hugging Face با هوش مصنوعی و Notion

9 دقیقه مطالعه · منتشر شده ۱۴۰۵/۴/۲۷

دانلود workflow

فایل JSON آماده import در n8n — credentialها باید در n8n شما تنظیم شوند.

  1. فایل JSON را دانلود کنید.
  2. در n8n: Workflows → Import from File.
  3. Credentialهای هر node را متصل کنید.
  4. workflow را فعال کنید.

شناسه workflow: 2804 · منبع: کاتالوگ Axeto

تجزیه و تحلیل خودکار مقالات Hugging Face با هوش مصنوعی و ذخیره‌سازی در Notion

این گردش کار، فرآیند دریافت، تجزیه و تحلیل و ذخیره‌سازی خلاصه‌های مقالات علمی از Hugging Face را در یک پایگاه داده Notion خودکار می‌کند. این گردش کار به صورت روزانه اجرا می‌شود، از هوش مصنوعی برای تجزیه و تحلیل عمیق استفاده می‌کند و اطمینان حاصل می‌کند که هیچ ورودی تکراری ایجاد نمی‌شود.

نمای کلی گردش کار

این گردش کار به گونه‌ای طراحی شده است که:

1. به طور خودکار آغاز شود: روزانه در زمان برنامه‌ریزی شده شروع شود.

2. آخرین مقالات را دریافت کند: لیست مقالات اخیر را از Hugging Face بازیابی کند.

3. لینک مقالات را استخراج کند: لیست‌ها را تجزیه و تحلیل کرده و URL مقالات را دریافت کند.

4. هر مقاله را پردازش کند: URLهای استخراج شده را پیمایش کند.

5. از تکراری شدن جلوگیری کند: بررسی کند که آیا مقاله از قبل در Notion وجود دارد یا خیر.

6. جزئیات مقاله را جمع‌آوری کند: برای مقالات جدید، محتوای کامل HTML آن‌ها را دریافت کند.

7. اطلاعات کلیدی را استخراج کند: HTML را تجزیه و تحلیل کرده و عنوان و چکیده مقاله را دریافت کند.

8. تجزیه و تحلیل مبتنی بر هوش مصنوعی: از مدل GPT OpenAI برای تجزیه و تحلیل چکیده و استخراج بینش‌های ساختاریافته استفاده کند.

9. در Notion ذخیره کند: داده‌های تجزیه و تحلیل شده و فراداده را در یک پایگاه داده Notion مشخص ذخیره کند.

تشریح گره به گره

۱. ماشه زمان‌بندی شده

  • هدف: شروع خودکار گردش کار.
  • نوع گره: Schedule Trigger
  • پیکربندی: تنظیم شده برای اجرا در روزهای کاری (دوشنبه تا جمعه) در ساعت ۸ صبح.
  • ورودی: ندارد.
  • خروجی: گره بعدی را برای دریافت داده‌ها فعال می‌کند.

۲. دریافت مقالات Hugging Face

  • هدف: دریافت لیستی از مقالات اخیر از Hugging Face.
  • نوع گره: HTTP Request
  • پیکربندی:

* URL: https://huggingface.co/papers

* پارامترهای کوئری: date تنظیم شده بر روی تاریخ دیروز در فرمت yyyy-MM-dd (مثال: ={{ $now.minus(1,'days').format('yyyy-MM-dd') }}).

  • ورودی: خروجی از Schedule Trigger.
  • خروجی: محتوای خام HTML صفحه مقالات Hugging Face.
  • مشکلات احتمالی: تغییرات در API Hugging Face، خطاهای شبکه.

۳. استخراج URL مقالات

  • هدف: تجزیه پاسخ HTML برای استخراج URL مقالات جداگانه.
  • نوع گره: HTML Extract
  • پیکربندی:

* عملیات: استخراج محتوای HTML.

* مقادیر استخراج:

* کلید: url

* انتخابگر CSS: .line-clamp-3

* ویژگی: href

* بازگرداندن آرایه: true

  • ورودی: خروجی از Fetch Hugging Face Papers.
  • خروجی: آرایه‌ای از URL مقالات.
  • مشکلات احتمالی: تغییرات در ساختار وب‌سایت Hugging Face یا کلاس‌های CSS.

۴. تفکیک URL مقالات

  • هدف: جدا کردن آرایه URLها به موارد جداگانه برای پردازش.
  • نوع گره: Split Out
  • پیکربندی:

* فیلد برای تفکیک: url

  • ورودی: خروجی از Extract Paper URLs.
  • خروجی: URLهای مقالات جداگانه، هر کدام به عنوان یک مورد.

۵. پردازش مقالات در دسته‌ها

  • هدف: پیمایش هر URL مقاله، پردازش آن‌ها یکی یکی بدون بازنشانی دسته.
  • نوع گره: Split In Batches
  • پیکربندی:

* اندازه دسته: 1

* بازنشانی دسته: false

  • ورودی: خروجی از Split Paper URLs.
  • خروجی: یک URL مقاله در هر تکرار.
  • مشکلات احتمالی: پردازش تعداد بسیار زیادی مقاله ممکن است بر عملکرد تأثیر بگذارد.

۶. بررسی وجود مقاله در Notion

  • هدف: تأیید اینکه آیا URL مقاله فعلی از قبل در پایگاه داده Notion وجود دارد یا خیر.
  • نوع گره: Notion (Get All Pages)
  • پیکربندی:

* شناسه پایگاه داده: شناسه پایگاه داده Notion هدف شما.

* فیلتر: صفحاتی را جستجو کنید که در آن‌ها ویژگی URL (یا نام ویژگی معادل شما) با URL مقاله فعلی مطابقت دارد.

  • ورودی: URL مقاله تکی از Process Papers in Batches.
  • خروجی: لیستی از صفحات Notion مطابق (خالی اگر مقاله جدید باشد).
  • اعتبارنامه‌ها: نیاز به توکن API Notion شما دارد.
  • مشکلات احتمالی: شناسه پایگاه داده یا نام ویژگی نادرست، محدودیت‌های نرخ API Notion.

۷. شرطی: مقاله جدید؟

  • هدف: تعیین اینکه آیا باید بر اساس بررسی Notion، به دریافت و تجزیه و تحلیل مقاله ادامه داد یا خیر.
  • نوع گره: If
  • پیکربندی:

* شرط: بررسی کنید که آیا خروجی از Check if Paper Exists in Notion خالی است (مثال: {{ $json.checkPaperUrlExisted.length === 0 }}).

  • ورودی: خروجی از Check if Paper Exists in Notion.
  • خروجی:

* درست: به دریافت جزئیات مقاله ادامه می‌دهد.

* نادرست: به تکرار بعدی حلقه می‌پرد (به طور موثر مقالات موجود را نادیده می‌گیرد).

۸. دریافت صفحه جزئیات مقاله

  • هدف: دریافت محتوای کامل HTML صفحه جزئیات یک مقاله خاص.
  • نوع گره: HTTP Request
  • پیکربندی:

* URL: به صورت پویا با استفاده از URL مقاله ساخته می‌شود (مثال: https://huggingface.co/{{ $json.processPapersInBatches.url }}).

* متد: GET

  • ورودی: خروجی از گره If (زمانی که شرط درست است).
  • خروجی: محتوای HTML صفحه جزئیات مقاله.
  • مشکلات احتمالی: خطاهای شبکه، صفحه یافت نشد، تغییرات در ساختار صفحه Hugging Face.

۹. استخراج عنوان و چکیده

  • هدف: استخراج متن عنوان و چکیده مقاله از محتوای HTML آن.
  • نوع گره: HTML Extract
  • پیکربندی:

* عملیات: استخراج محتوای HTML.

* مقادیر استخراج:

* کلید: title, انتخابگر CSS: .text-2xl (در صورت نیاز تنظیم شود)

* کلید: abstract, انتخابگر CSS: .text-gray-700 (در صورت نیاز تنظیم شود)

  • ورودی: خروجی از Fetch Paper Detail Page.
  • خروجی: شیء JSON حاوی title و abstract.
  • مشکلات احتمالی: تغییرات در ساختار HTML Hugging Face یا انتخابگرهای CSS.

۱۰. تجزیه چکیده با OpenAI

  • هدف: استفاده از یک مدل هوش مصنوعی (GPT-4o) برای تجزیه و تحلیل چکیده استخراج شده و تولید بینش‌های ساختاریافته.
  • نوع گره: OpenAI (گره Langchain)
  • پیکربندی:

* مدل: gpt-4o-2024-11-20 (یا مدل ترجیحی شما).

* دستور سیستم: هوش مصنوعی را برای استخراج اطلاعات خاصی مانند "مقدمه اصلی"، "کلمات کلیدی (۲-۵)"، "داده‌ها و نتایج کلیدی"، "جزئیات فنی" و "طبقه‌بندی (دسته‌های آکادمیک)" راهنمایی کنید.

* دستور کاربر: متن چکیده استخراج شده.

* فرمت خروجی: JSON.

  • ورودی: متن چکیده از Extract Title and Abstract.
  • خروجی: شیء JSON با تجزیه و تحلیل تولید شده توسط هوش مصنوعی.
  • اعتبارنامه‌ها: نیاز به کلید API OpenAI شما دارد.
  • مشکلات احتمالی: محدودیت‌های نرخ API OpenAI، چالش‌های مهندسی دستور، فرمت‌های خروجی غیرمنتظره.

۱۱. ذخیره تجزیه و تحلیل در Notion

  • هدف: ذخیره فراداده مقاله و تجزیه و تحلیل تولید شده توسط هوش مصنوعی در پایگاه داده Notion شما.
  • نوع گره: Notion (Create Database Page)
  • پیکربندی:

* شناسه پایگاه داده: شناسه پایگاه داده Notion هدف شما.

* نگاشت ویژگی‌ها:

* URL: URL کامل مقاله Hugging Face.

* Title: عنوان مقاله استخراج شده.

* Abstract: متن چکیده استخراج شده (در صورت لزوم کوتاه کردن را در نظر بگیرید، مثال: {{ $json.extractTitleAndAbstract.abstract.substring(0, 2000) }}).

* Scrap Date: تاریخ فعلی ({{ $now.toFormat('yyyy-MM-dd') }}).

* سایر ویژگی‌ها را نگاشت کنید (مثال: Classification, Technical Details, Data and Results, Keywords, Core Introduction) از خروجی JSON تجزیه و تحلیل OpenAI.

  • ورودی: خروجی از Analyze Abstract with OpenAI.
  • اعتبارنامه‌ها: نیاز به توکن API Notion شما دارد.
  • مشکلات احتمالی: محدودیت‌های نرخ API Notion، نام ویژگی نادرست، عدم تطابق انواع داده.

جدول خلاصه

نام گرهنوع گرهعملکردگره(های) ورودیگره(های) خروجی
Schedule TriggerSchedule Triggerشروع گردش کار روزانهNoneFetch Hugging Face Papers
Fetch Hugging Face PapersHTTP Requestدریافت HTML لیست مقالاتSchedule TriggerExtract Paper URLs
Extract Paper URLsHTML Extractدریافت URL مقالات از HTMLFetch Hugging Face PapersSplit Paper URLs
Split Paper URLsSplit Outجدا کردن URLها به موارد جداگانهExtract Paper URLsProcess Papers in Batches
Process Papers in BatchesSplit In Batchesپیمایش هر URLSplit Paper URLsCheck if Paper Exists in Notion
Check if Paper Exists in NotionNotion (Get All Pages)بررسی وجود مقاله در NotionProcess Papers in BatchesConditional: New Paper?
Conditional: New Paper?Ifتصمیم‌گیری برای ادامه کارCheck if Paper Exists in NotionFetch Paper Detail Page (True)
Fetch Paper Detail PageHTTP Requestدریافت HTML کامل مقالهConditional: New Paper? (True)Extract Title and Abstract
Extract Title and AbstractHTML Extractدریافت متن عنوان و چکیدهFetch Paper Detail PageAnalyze Abstract with OpenAI
Analyze Abstract with OpenAIOpenAI (گره Langchain)تجزیه و تحلیل هوش مصنوعی چکیدهExtract Title and AbstractStore Analysis in Notion
Store Analysis in NotionNotion (Create Database Page)ذخیره داده‌ها در NotionAnalyze Abstract with OpenAIProcess Papers in Batches (Loop back)

نحوه بازسازی این گردش کار

1. افزودن Schedule Trigger: آن را برای اجرا روزانه (یا در روزهای کاری) در زمان دلخواه خود پیکربندی کنید.

2. افزودن HTTP Request (Fetch Hugging Face Papers): URL را روی https://huggingface.co/papers تنظیم کنید و پارامتر کوئری پویا date را اضافه کنید.

3. افزودن HTML Extract (Extract Paper URLs): آن را برای استخراج ویژگی‌های href از انتخابگر .line-clamp-3 و بازگرداندن یک آرایه پیکربندی کنید.

4. افزودن Split Out: url را به عنوان فیلد برای تفکیک مشخص کنید.

5. افزودن Split In Batches (Process Papers in Batches): اندازه دسته را روی 1 و بازنشانی دسته را روی false تنظیم کنید.

6. افزودن Notion (Get All Pages) (Check if Paper Exists): آن را برای جستجو در پایگاه داده Notion خود با استفاده از URL مقاله به عنوان فیلتر پیکربندی کنید. اطمینان حاصل کنید که توکن API Notion شما تنظیم شده است.

7. افزودن گره If (Conditional: New Paper?): شرط را برای بررسی اینکه آیا خروجی گره Notion خالی است، تنظیم کنید.

8. افزودن HTTP Request (Fetch Paper Detail Page): URL را به صورت پویا با استفاده از URL مقاله از مرحله قبل بسازید.

9. افزودن HTML Extract (Extract Title and Abstract): آن را برای استخراج عنوان و چکیده با استفاده از انتخابگرهای CSS مناسب پیکربندی کنید.

10. افزودن OpenAI (Analyze Abstract with OpenAI): مدل، دستور سیستم و دستور کاربر خود را پیکربندی کنید. اطمینان حاصل کنید که کلید API OpenAI شما تنظیم شده است.

11. افزودن Notion (Create Database Page) (Store Analysis in Notion): فیلدها را از گره‌های قبلی به ویژگی‌های پایگاه داده Notion خود نگاشت کنید. اطمینان حاصل کنید که توکن API Notion شما تنظیم شده است.

12. گره‌ها را مطابق با نمای کلی گردش کار و جدول خلاصه به هم متصل کنید.

این گردش کار یک راه حل قوی برای به‌روز ماندن با تحقیقات هوش مصنوعی از Hugging Face و سازماندهی مؤثر اطلاعات در Notion ارائه می‌دهد.

Nodeهای استفاده‌شده

سوالات متداول

این گردش کار n8n چه کاری انجام می‌دهد؟

این گردش کار به طور خودکار مقالات جدید منتشر شده در Hugging Face را دریافت می‌کند، آن‌ها را با استفاده از هوش مصنوعی (مدل GPT) تحلیل می‌کند و خلاصه‌ها و اطلاعات کلیدی را در یک پایگاه داده Notion ذخیره می‌نماید. همچنین از ایجاد ورودی‌های تکراری جلوگیری می‌کند.

چه ابزارها و سرویس‌هایی برای اجرای این گردش کار لازم است؟

برای اجرای این گردش کار به n8n، دسترسی به Hugging Face (برای دریافت مقالات)، سرویس OpenAI (برای تحلیل با هوش مصنوعی) و یک پایگاه داده Notion نیاز دارید. همچنین نیاز به توکن API برای Notion و OpenAI خواهید داشت.

چگونه از تکراری شدن مقالات در Notion جلوگیری می‌شود؟

گردش کار قبل از افزودن هر مقاله به Notion، با جستجو در پایگاه داده موجود بر اساس URL مقاله، بررسی می‌کند که آیا آن مقاله از قبل ثبت شده است یا خیر. در صورت وجود، از ثبت مجدد آن جلوگیری می‌کند.

این گردش کار چگونه اطلاعات مقاله را استخراج و تحلیل می‌کند؟

ابتدا URL مقالات از صفحه Hugging Face استخراج می‌شود. سپس محتوای HTML هر مقاله دریافت شده و عنوان و چکیده آن استخراج می‌گردد. در نهایت، چکیده مقاله به مدل GPT ارسال می‌شود تا تحلیل شده و بینش‌های ساختاریافته استخراج گردد.

workflowهای مرتبط

این workflow در کاتالوگ Axeto.ai بایگانی شده است. لایسنس اصلی متعلق به سازنده workflow است.