پردازش هوشمند اسناد با Gemini و VLM Run در n8n

پردازش هوشمند اسناد با Gemini و VLM Run در n8n

10 دقیقه مطالعه · منتشر شده ۱۴۰۵/۴/۲۶

دانلود workflow

فایل JSON آماده import در n8n — credentialها باید در n8n شما تنظیم شوند.

  1. فایل JSON را دانلود کنید.
  2. در n8n: Workflows → Import from File.
  3. Credentialهای هر node را متصل کنید.
  4. workflow را فعال کنید.

شناسه workflow: 8788 · منبع: کاتالوگ Axeto

پردازش و سازماندهی اسناد با هوش مصنوعی با استفاده از Gemini، VLM Run و Google Sheets

این گردش کار، پردازش و سازماندهی اسناد آپلود شده در Google Drive را خودکار می‌کند. این گردش کار از Google Gemini برای طبقه‌بندی نوع سند، VLM Run برای استخراج داده‌های ساختاریافته و Google Sheets برای ذخیره‌سازی پویا داده‌ها بهره می‌برد. این راه‌حل برای مدیریت انواع مختلف اسناد مانند رسیدها، رزومه‌ها، ادعاهای درمانی، دستورات پزشک و نقشه‌های ساختمانی ایده‌آل است.

ویژگی‌های کلیدی:

  • تشخیص خودکار فایل: پوشه مشخصی در Google Drive را برای آپلودهای جدید نظارت می‌کند.
  • طبقه‌بندی هوشمند سند: از Google Gemini برای شناسایی نوع هر سند استفاده می‌کند.
  • استخراج داده‌های ساختاریافته: از عامل VLM Run برای استخراج داده‌های آگاه از OCR و طرح‌بندی استفاده می‌کند.
  • ذخیره‌سازی پویای داده: داده‌های استخراج شده را بر اساس نوع سند به‌طور خودکار به Google Sheet صحیح هدایت می‌کند.
  • مدیریت طرح‌بندی (Schema): قبل از افزودن داده‌ها، اطمینان حاصل می‌کند که Google Sheets هدف دارای هدرهای لازم هستند.

---

تشریح گردش کار (Workflow Breakdown)

این گردش کار به بلوک‌های منطقی تقسیم شده است که هر کدام مسئول یک مرحله مشخص در خط پردازش سند هستند.

۱. دریافت و دانلود ورودی

این بلوک مسئول نظارت بر پوشه‌ای در Google Drive برای آپلود فایل‌های جدید و دانلود آن‌ها برای پردازش بعدی است.

  • نودها (Nodes):

* Monitor Uploads (Google Drive Trigger)

* Download File (Google Drive)

  • Monitor Uploads (Google Drive Trigger):

* هدف: به طور مداوم یک پوشه مشخص در Google Drive را برای ایجاد فایل‌های جدید زیر نظر دارد.

* تریگر (Trigger): هنگام شناسایی یک فایل جدید، گردش کار را آغاز می‌کند.

* خروجی: فراداده فایل آپلود شده جدید، از جمله شناسه آن را ارائه می‌دهد.

* پیکربندی: برای بررسی پوشه در یک بازه زمانی مشخص (مثلاً هر دقیقه) تنظیم شده است.

* مشکلات احتمالی: محدودیت‌های نرخ API، مجوزهای نادرست پوشه، یا خطاهای احراز هویت.

  • Download File (Google Drive):

* هدف: محتوای باینری فایلی را که توسط نود Monitor Uploads شناسایی شده است، دانلود می‌کند.

* ورودی: شناسه فایل به دست آمده از نود تریگر.

* خروجی: داده‌های باینری فایل، ذخیره شده در پراپرتی data، آماده برای تحلیل هوش مصنوعی.

* مشکلات احتمالی: یافت نشدن فایل، عدم وجود مجوز کافی، یا قطع شدن دانلود.

۲. طبقه‌بندی نوع سند

این بلوک از هوش مصنوعی Google Gemini برای تعیین نوع سند آپلود شده استفاده می‌کند. این طبقه‌بندی برای هدایت فرآیندهای استخراج و ذخیره‌سازی داده‌ها حیاتی است.

  • نودها (Nodes):

* Check Document Type (Google Gemini AI)

* Download File2 (Google Drive)

  • Check Document Type (Google Gemini AI):

* هدف: محتوای باینری سند را برای طبقه‌بندی نوع آن (مثلاً "رسید"، "رزومه"، "فاکتور") تجزیه و تحلیل می‌کند.

* ورودی: محتوای باینری فایل از نود Download File.

* خروجی: یک شیء JSON حاوی نوع سند شناسایی شده به صورت رشته.

* پیکربندی: از یک مدل Gemini خاص (مثلاً models/gemini-2.5-flash) استفاده می‌کند.

* مشکلات احتمالی: فراتر رفتن از سهمیه‌های API، ناتوانی در شناسایی سند، یا خطاهای فرمت سند.

  • Download File2 (Google Drive):

* هدف: همان فایل را دوباره دانلود می‌کند. این یک مرحله ضروری برای اطمینان از در دسترس بودن داده‌های باینری در یک پراپرتی جداگانه (data2) برای نود VLM Run است تا سازگاری حفظ شود.

* ورودی: شناسه فایل از نود Monitor Uploads.

* خروجی: محتوای باینری فایل، ذخیره شده در پراپرتی data2.

* مشکلات احتمالی: مشابه نود Download File.

۳. استخراج داده

این بلوک از VLM Run Execute Agent برای انجام تشخیص نوری کاراکتر (OCR) و تحلیل چیدمان سند، و استخراج داده‌های ساختاریافته استفاده می‌کند.

  • نودها (Nodes):

* VLM Run for Extraction (VLM Run Agent)

  • VLM Run for Extraction (VLM Run Agent):

* هدف: محتوای باینری سند را با دستورالعمل‌هایی برای استخراج داده بر اساس نوع آن به VLM Run ارسال می‌کند.

* ورودی: داده‌های باینری از نود Download File2.

* خروجی: یک شیء JSON حاوی داده‌های ساختاریافته و استخراج شده.

* پیکربندی:

* agentPrompt به طور پویا نوع سند شناسایی شده توسط Gemini را در بر می‌گیرد.

* به اعتبارنامه‌های API VLM Run نیاز دارد.

* مشکلات احتمالی: قطع شدن عامل (Agent timeouts)، خطاهای API، فرمت‌های فایل پشتیبانی نشده، یا فایل‌های خراب.

۴. وب‌هوک دریافت داده

این بلوک به عنوان یک نقطه پایانی ناهمزمان برای دریافت داده‌های ساختاریافته استخراج شده توسط عامل VLM Run عمل می‌کند.

  • نودها (Nodes):

* Receives Extracted Data (Webhook)

  • Receives Extracted Data (Webhook):

* هدف: بار داده JSON حاوی داده‌های استخراج شده را که از طریق درخواست HTTP POST از عامل VLM Run ارسال شده است، می‌پذیرد.

* ورودی: پاسخ JSON از عامل VLM Run.

* خروجی: بلوک بعدی را تریگر می‌کند و فرآیند ذخیره‌سازی هوشمند داده را آغاز می‌کند.

* مشکلات احتمالی: پیکربندی نادرست وب‌هوک، مشکلات اتصال شبکه، یا محدودیت‌های امنیتی.

۵. ذخیره‌سازی هوشمند داده

این بلوک فرآیند ذخیره داده‌های استخراج شده را در Google Sheet مناسب سازماندهی می‌کند. از یک عامل هوش مصنوعی برای تعیین پویا شیت هدف، مدیریت هدرها و افزودن ردیف‌های جدید استفاده می‌کند.

  • نودها (Nodes):

* AI Agent for Storing Dynamically (LangChain Agent)

* Get row(s) from sheets (Google Sheets Tool)

* Append row (HTTP Request Tool)

* OpenAI Chat Model (LangChain OpenAI Chat)

  • AI Agent for Storing Dynamically (LangChain Agent):

* هدف: منطق ذخیره داده‌های استخراج شده را مدیریت می‌کند. نوع سند را تجزیه و تحلیل می‌کند، یک شیت ایندکس اصلی را برای یافتن صفحه گسترده هدف صحیح مشورت می‌کند، هدرهای موجود را بررسی می‌کند و داده‌ها را اضافه می‌کند. اگر نوع سندی شناسایی نشود، یک ورودی عمومی ثبت می‌کند.

* ورودی: داده‌های JSON دریافتی از وب‌هوک Receives Extracted Data.

* خروجی: عملیات Google Sheets (خواندن و افزودن) را تریگر می‌کند.

* پیکربندی:

* یک پرامپت سیستمی دقیق، عامل را در نگاشت انواع سند به Google Sheets و ساختارهای ستونی خاص راهنمایی می‌کند.

* پردازش داخلی به حداکثر ۱۰ تکرار محدود می‌شود.

* مشکلات احتمالی: خطاهای پرامپت هوش مصنوعی، خرابی API، مشکلات تجزیه JSON، یا مشکلات دسترسی به Google Sheets.

  • Get row(s) from sheets (Google Sheets Tool):

* هدف: ردیف‌های هدر موجود را از Google Sheet هدف تعیین شده بازیابی می‌کند تا ساختار ستون را تأیید کند.

* ورودی: شناسه صفحه گسترده که به طور پویا توسط عامل هوش مصنوعی ارائه می‌شود.

* خروجی: ردیف‌های شیت، که برای تأیید هدر استفاده می‌شود.

* مشکلات احتمالی: یافت نشدن شیت یا خطاهای مجوز.

  • Append row (HTTP Request Tool):

* هدف: داده‌ها (هدرها یا ردیف‌های استخراج شده) را با استفاده از Google Sheets API v4 به Google Sheet هدف اضافه می‌کند.

* ورودی: URL و بدنه JSON که به طور پویا توسط عامل هوش مصنوعی تولید شده است.

* پیکربندی:

* از پارامترهای کوئری valueInputOption=RAW و insertDataOption=INSERT_ROWS استفاده می‌کند.

* هدر Content-Type را روی application/json تنظیم می‌کند.

* مشکلات احتمالی: محدودیت‌های سهمیه API، بدنه درخواست نامعتبر، یا خرابی احراز هویت.

  • OpenAI Chat Model (LangChain OpenAI Chat):

* هدف: قابلیت‌های درک زبان طبیعی و تصمیم‌گیری را برای عامل هوش مصنوعی فراهم می‌کند.

* پیکربندی: از یک مدل OpenAI خاص (مثلاً gpt-4.1) استفاده می‌کند.

* مشکلات احتمالی: محدودیت‌های نرخ API یا مشکلات اتصال شبکه.

---

جدول خلاصه

نام نود (Node Name)نوع نود (Node Type)نقش عملکردی (Functional Role)نود(های) ورودی (Input Node(s))نود(های) خروجی (Output Node(s))توضیحات یادداشت چسبان (Sticky Note Description)
🧾 نمای کلی گردش کار (Workflow Overview)یادداشت چسبان (Sticky Note)نمای کلی سطح بالا از کل گردش کار را ارائه می‌دهد.## 🧾 گردش کار استخراج داده با هوش مصنوعی: آپلود در Google Drive → Gemini نوع سند را طبقه‌بندی می‌کند → VLM Run فیلدهای ساختاریافته را استخراج می‌کند...
📁 مستندات پردازش ورودی (Input Processing Documentation)یادداشت چسبان (Sticky Note)نظارت بر ورودی و مدیریت فایل‌ها را توصیف می‌کند.## 📁 پردازش ورودی: فایل‌ها را از Google Drive برای پردازش خودکار نظارت و دانلود می‌کند.
🤖 مستندات استخراج هوش مصنوعی (AI Extraction Documentation)یادداشت چسبان (Sticky Note)قابلیت‌های استخراج مبتنی بر هوش مصنوعی را توضیح می‌دهد.## 🤖 استخراج هوش مصنوعی: از Gemini برای تشخیص نوع سند و VLM Run Execute Agent برای استخراج داده‌های ساختاریافته استفاده می‌کند.
📊 مستندات ذخیره‌سازی (Storage Documentation)یادداشت چسبان (Sticky Note)منطق ذخیره‌سازی داده در Google Sheets را شرح می‌دهد.## 📊 ذخیره‌سازی داده: داده‌های استخراج‌شده را بر اساس نوع سند به‌طور خودکار در Google Sheets ساختاردهی و ذخیره می‌کند.
Monitor UploadsGoogle Drive Triggerپوشه Google Drive را برای فایل‌های جدید زیر نظر دارد.Download Fileپوشه Google Drive را برای آپلودهای جدید فایل نظارت می‌کند و گردش کار را به‌طور خودکار راه‌اندازی می‌کند.
Download FileGoogle Driveفایل‌ها را برای پردازش هوش مصنوعی دانلود می‌کند.Monitor UploadsCheck Document Typeفایل‌ها را از Google Drive برای آماده‌سازی جهت تجزیه و تحلیل مبتنی بر هوش مصنوعی دانلود می‌کند.
Check Document TypeGoogle Gemini AIنوع سند را از ورودی باینری طبقه‌بندی می‌کند.Download FileDownload File2محتوای سند را برای تعیین نوع آن (مانند رسید، فاکتور) تجزیه و تحلیل می‌کند.
Download File2Google Driveفایل را دوباره برای استخراج VLM Run دانلود می‌کند.Check Document TypeVLM Run for Extractionفایل را دوباره دانلود می‌کند تا اطمینان حاصل شود که داده‌های باینری برای نود VLM Run در دسترس هستند.
VLM Run for ExtractionVLM Run Agentداده‌های ساختاریافته را با استفاده از OCR و طرح‌بندی استخراج می‌کند.Download File2Receives Extracted Data (via webhook)از VLM Run برای استخراج اطلاعات ساختاریافته، از جمله متن و جزئیات طرح‌بندی، از سند استفاده می‌کند.
Receives Extracted DataWebhookداده‌های JSON استخراج‌شده را از VLM Run دریافت می‌کند.VLM Run for ExtractionAI Agent for Storing Dynamicallyبه‌عنوان یک نقطه پایانی برای دریافت محموله داده‌های ساختاریافته از عامل VLM Run عمل می‌کند.
AI Agent for Storing DynamicallyLangChain Agentمنطق ذخیره‌سازی پویای داده را هماهنگ می‌کند.Receives Extracted DataGet row(s) from sheets, Append rowذخیره‌سازی هوشمند داده‌های استخراج‌شده را مدیریت می‌کند، Google Sheet صحیح را تعیین کرده و به‌روزرسانی‌های طرح‌بندی را مدیریت می‌کند.
Get row(s) from sheetsGoogle Sheets Toolردیف‌های موجود (سرصفحه‌ها) را از یک صفحه می‌خواند.AI Agent for Storing DynamicallyAI Agent for Storing Dynamicallyساختار سرصفحه Google Sheet هدف را قبل از افزودن داده‌های جدید تأیید می‌کند.
Append rowHTTP Request Toolردیف‌ها را از طریق API به Google Sheet اضافه می‌کند.AI Agent for Storing Dynamicallyردیف‌های جدید، از جمله سرصفحه‌ها در صورت لزوم، را با استفاده از Google Sheets API به Google Sheet تعیین‌شده اضافه می‌کند.
OpenAI Chat ModelLangChain OpenAI Chatقابلیت‌های هوش مصنوعی را برای LangChain Agent فراهم می‌کند.AI Agent for Storing DynamicallyAI Agent for Storing Dynamicallyتصمیم‌گیری و پردازش زبان طبیعی را در عامل هوش مصنوعی تقویت می‌کند.

Nodeهای استفاده‌شده

سوالات متداول

این گردش کار n8n چه کاری انجام می‌دهد؟

این گردش کار اسناد آپلود شده در Google Drive را به طور خودکار پردازش و سازماندهی می‌کند. از Google Gemini برای طبقه‌بندی نوع سند و VLM Run برای استخراج داده‌های ساختاریافته استفاده می‌کند و سپس داده‌ها را بر اساس نوع سند به Google Sheets هدایت می‌کند.

چه نوع اسنادی را می‌توان با این گردش کار پردازش کرد؟

این گردش کار برای مدیریت انواع مختلف اسناد مانند رسیدها، رزومه‌ها، ادعاهای درمانی، دستورات پزشک و نقشه‌های ساختمانی ایده‌آل است.

نقش Google Gemini در این گردش کار چیست؟

Google Gemini برای طبقه‌بندی هوشمند نوع هر سند استفاده می‌شود. این طبقه‌بندی برای هدایت فرآیندهای بعدی استخراج و ذخیره‌سازی داده‌ها حیاتی است.

VLM Run چه وظیفه‌ای را بر عهده دارد؟

VLM Run برای استخراج داده‌های ساختاریافته از اسناد به کار می‌رود. این ابزار با استفاده از قابلیت‌های OCR و تحلیل طرح‌بندی، داده‌های مورد نیاز را استخراج می‌کند.

workflowهای مرتبط

این workflow در کاتالوگ Axeto.ai بایگانی شده است. لایسنس اصلی متعلق به سازنده workflow است.