
پردازش هوشمند اسناد با Gemini و VLM Run در n8n
10 دقیقه مطالعه · منتشر شده ۱۴۰۵/۴/۲۶
دانلود workflow
فایل JSON آماده import در n8n — credentialها باید در n8n شما تنظیم شوند.
- فایل JSON را دانلود کنید.
- در n8n: Workflows → Import from File.
- Credentialهای هر node را متصل کنید.
- workflow را فعال کنید.
شناسه workflow: 8788 · منبع: کاتالوگ Axeto
پردازش و سازماندهی اسناد با هوش مصنوعی با استفاده از Gemini، VLM Run و Google Sheets
این گردش کار، پردازش و سازماندهی اسناد آپلود شده در Google Drive را خودکار میکند. این گردش کار از Google Gemini برای طبقهبندی نوع سند، VLM Run برای استخراج دادههای ساختاریافته و Google Sheets برای ذخیرهسازی پویا دادهها بهره میبرد. این راهحل برای مدیریت انواع مختلف اسناد مانند رسیدها، رزومهها، ادعاهای درمانی، دستورات پزشک و نقشههای ساختمانی ایدهآل است.
ویژگیهای کلیدی:
- تشخیص خودکار فایل: پوشه مشخصی در Google Drive را برای آپلودهای جدید نظارت میکند.
- طبقهبندی هوشمند سند: از Google Gemini برای شناسایی نوع هر سند استفاده میکند.
- استخراج دادههای ساختاریافته: از عامل VLM Run برای استخراج دادههای آگاه از OCR و طرحبندی استفاده میکند.
- ذخیرهسازی پویای داده: دادههای استخراج شده را بر اساس نوع سند بهطور خودکار به Google Sheet صحیح هدایت میکند.
- مدیریت طرحبندی (Schema): قبل از افزودن دادهها، اطمینان حاصل میکند که Google Sheets هدف دارای هدرهای لازم هستند.
---
تشریح گردش کار (Workflow Breakdown)
این گردش کار به بلوکهای منطقی تقسیم شده است که هر کدام مسئول یک مرحله مشخص در خط پردازش سند هستند.
۱. دریافت و دانلود ورودی
این بلوک مسئول نظارت بر پوشهای در Google Drive برای آپلود فایلهای جدید و دانلود آنها برای پردازش بعدی است.
- نودها (Nodes):
* Monitor Uploads (Google Drive Trigger)
* Download File (Google Drive)
-
Monitor Uploads(Google Drive Trigger):
* هدف: به طور مداوم یک پوشه مشخص در Google Drive را برای ایجاد فایلهای جدید زیر نظر دارد.
* تریگر (Trigger): هنگام شناسایی یک فایل جدید، گردش کار را آغاز میکند.
* خروجی: فراداده فایل آپلود شده جدید، از جمله شناسه آن را ارائه میدهد.
* پیکربندی: برای بررسی پوشه در یک بازه زمانی مشخص (مثلاً هر دقیقه) تنظیم شده است.
* مشکلات احتمالی: محدودیتهای نرخ API، مجوزهای نادرست پوشه، یا خطاهای احراز هویت.
-
Download File(Google Drive):
* هدف: محتوای باینری فایلی را که توسط نود Monitor Uploads شناسایی شده است، دانلود میکند.
* ورودی: شناسه فایل به دست آمده از نود تریگر.
* خروجی: دادههای باینری فایل، ذخیره شده در پراپرتی data، آماده برای تحلیل هوش مصنوعی.
* مشکلات احتمالی: یافت نشدن فایل، عدم وجود مجوز کافی، یا قطع شدن دانلود.
۲. طبقهبندی نوع سند
این بلوک از هوش مصنوعی Google Gemini برای تعیین نوع سند آپلود شده استفاده میکند. این طبقهبندی برای هدایت فرآیندهای استخراج و ذخیرهسازی دادهها حیاتی است.
- نودها (Nodes):
* Check Document Type (Google Gemini AI)
* Download File2 (Google Drive)
-
Check Document Type(Google Gemini AI):
* هدف: محتوای باینری سند را برای طبقهبندی نوع آن (مثلاً "رسید"، "رزومه"، "فاکتور") تجزیه و تحلیل میکند.
* ورودی: محتوای باینری فایل از نود Download File.
* خروجی: یک شیء JSON حاوی نوع سند شناسایی شده به صورت رشته.
* پیکربندی: از یک مدل Gemini خاص (مثلاً models/gemini-2.5-flash) استفاده میکند.
* مشکلات احتمالی: فراتر رفتن از سهمیههای API، ناتوانی در شناسایی سند، یا خطاهای فرمت سند.
-
Download File2(Google Drive):
* هدف: همان فایل را دوباره دانلود میکند. این یک مرحله ضروری برای اطمینان از در دسترس بودن دادههای باینری در یک پراپرتی جداگانه (data2) برای نود VLM Run است تا سازگاری حفظ شود.
* ورودی: شناسه فایل از نود Monitor Uploads.
* خروجی: محتوای باینری فایل، ذخیره شده در پراپرتی data2.
* مشکلات احتمالی: مشابه نود Download File.
۳. استخراج داده
این بلوک از VLM Run Execute Agent برای انجام تشخیص نوری کاراکتر (OCR) و تحلیل چیدمان سند، و استخراج دادههای ساختاریافته استفاده میکند.
- نودها (Nodes):
* VLM Run for Extraction (VLM Run Agent)
-
VLM Run for Extraction(VLM Run Agent):
* هدف: محتوای باینری سند را با دستورالعملهایی برای استخراج داده بر اساس نوع آن به VLM Run ارسال میکند.
* ورودی: دادههای باینری از نود Download File2.
* خروجی: یک شیء JSON حاوی دادههای ساختاریافته و استخراج شده.
* پیکربندی:
* agentPrompt به طور پویا نوع سند شناسایی شده توسط Gemini را در بر میگیرد.
* به اعتبارنامههای API VLM Run نیاز دارد.
* مشکلات احتمالی: قطع شدن عامل (Agent timeouts)، خطاهای API، فرمتهای فایل پشتیبانی نشده، یا فایلهای خراب.
۴. وبهوک دریافت داده
این بلوک به عنوان یک نقطه پایانی ناهمزمان برای دریافت دادههای ساختاریافته استخراج شده توسط عامل VLM Run عمل میکند.
- نودها (Nodes):
* Receives Extracted Data (Webhook)
-
Receives Extracted Data(Webhook):
* هدف: بار داده JSON حاوی دادههای استخراج شده را که از طریق درخواست HTTP POST از عامل VLM Run ارسال شده است، میپذیرد.
* ورودی: پاسخ JSON از عامل VLM Run.
* خروجی: بلوک بعدی را تریگر میکند و فرآیند ذخیرهسازی هوشمند داده را آغاز میکند.
* مشکلات احتمالی: پیکربندی نادرست وبهوک، مشکلات اتصال شبکه، یا محدودیتهای امنیتی.
۵. ذخیرهسازی هوشمند داده
این بلوک فرآیند ذخیره دادههای استخراج شده را در Google Sheet مناسب سازماندهی میکند. از یک عامل هوش مصنوعی برای تعیین پویا شیت هدف، مدیریت هدرها و افزودن ردیفهای جدید استفاده میکند.
- نودها (Nodes):
* AI Agent for Storing Dynamically (LangChain Agent)
* Get row(s) from sheets (Google Sheets Tool)
* Append row (HTTP Request Tool)
* OpenAI Chat Model (LangChain OpenAI Chat)
-
AI Agent for Storing Dynamically(LangChain Agent):
* هدف: منطق ذخیره دادههای استخراج شده را مدیریت میکند. نوع سند را تجزیه و تحلیل میکند، یک شیت ایندکس اصلی را برای یافتن صفحه گسترده هدف صحیح مشورت میکند، هدرهای موجود را بررسی میکند و دادهها را اضافه میکند. اگر نوع سندی شناسایی نشود، یک ورودی عمومی ثبت میکند.
* ورودی: دادههای JSON دریافتی از وبهوک Receives Extracted Data.
* خروجی: عملیات Google Sheets (خواندن و افزودن) را تریگر میکند.
* پیکربندی:
* یک پرامپت سیستمی دقیق، عامل را در نگاشت انواع سند به Google Sheets و ساختارهای ستونی خاص راهنمایی میکند.
* پردازش داخلی به حداکثر ۱۰ تکرار محدود میشود.
* مشکلات احتمالی: خطاهای پرامپت هوش مصنوعی، خرابی API، مشکلات تجزیه JSON، یا مشکلات دسترسی به Google Sheets.
-
Get row(s) from sheets(Google Sheets Tool):
* هدف: ردیفهای هدر موجود را از Google Sheet هدف تعیین شده بازیابی میکند تا ساختار ستون را تأیید کند.
* ورودی: شناسه صفحه گسترده که به طور پویا توسط عامل هوش مصنوعی ارائه میشود.
* خروجی: ردیفهای شیت، که برای تأیید هدر استفاده میشود.
* مشکلات احتمالی: یافت نشدن شیت یا خطاهای مجوز.
-
Append row(HTTP Request Tool):
* هدف: دادهها (هدرها یا ردیفهای استخراج شده) را با استفاده از Google Sheets API v4 به Google Sheet هدف اضافه میکند.
* ورودی: URL و بدنه JSON که به طور پویا توسط عامل هوش مصنوعی تولید شده است.
* پیکربندی:
* از پارامترهای کوئری valueInputOption=RAW و insertDataOption=INSERT_ROWS استفاده میکند.
* هدر Content-Type را روی application/json تنظیم میکند.
* مشکلات احتمالی: محدودیتهای سهمیه API، بدنه درخواست نامعتبر، یا خرابی احراز هویت.
-
OpenAI Chat Model(LangChain OpenAI Chat):
* هدف: قابلیتهای درک زبان طبیعی و تصمیمگیری را برای عامل هوش مصنوعی فراهم میکند.
* پیکربندی: از یک مدل OpenAI خاص (مثلاً gpt-4.1) استفاده میکند.
* مشکلات احتمالی: محدودیتهای نرخ API یا مشکلات اتصال شبکه.
---
جدول خلاصه
| نام نود (Node Name) | نوع نود (Node Type) | نقش عملکردی (Functional Role) | نود(های) ورودی (Input Node(s)) | نود(های) خروجی (Output Node(s)) | توضیحات یادداشت چسبان (Sticky Note Description) |
|---|---|---|---|---|---|
| 🧾 نمای کلی گردش کار (Workflow Overview) | یادداشت چسبان (Sticky Note) | نمای کلی سطح بالا از کل گردش کار را ارائه میدهد. | ## 🧾 گردش کار استخراج داده با هوش مصنوعی: آپلود در Google Drive → Gemini نوع سند را طبقهبندی میکند → VLM Run فیلدهای ساختاریافته را استخراج میکند... | ||
| 📁 مستندات پردازش ورودی (Input Processing Documentation) | یادداشت چسبان (Sticky Note) | نظارت بر ورودی و مدیریت فایلها را توصیف میکند. | ## 📁 پردازش ورودی: فایلها را از Google Drive برای پردازش خودکار نظارت و دانلود میکند. | ||
| 🤖 مستندات استخراج هوش مصنوعی (AI Extraction Documentation) | یادداشت چسبان (Sticky Note) | قابلیتهای استخراج مبتنی بر هوش مصنوعی را توضیح میدهد. | ## 🤖 استخراج هوش مصنوعی: از Gemini برای تشخیص نوع سند و VLM Run Execute Agent برای استخراج دادههای ساختاریافته استفاده میکند. | ||
| 📊 مستندات ذخیرهسازی (Storage Documentation) | یادداشت چسبان (Sticky Note) | منطق ذخیرهسازی داده در Google Sheets را شرح میدهد. | ## 📊 ذخیرهسازی داده: دادههای استخراجشده را بر اساس نوع سند بهطور خودکار در Google Sheets ساختاردهی و ذخیره میکند. | ||
Monitor Uploads | Google Drive Trigger | پوشه Google Drive را برای فایلهای جدید زیر نظر دارد. | Download File | پوشه Google Drive را برای آپلودهای جدید فایل نظارت میکند و گردش کار را بهطور خودکار راهاندازی میکند. | |
Download File | Google Drive | فایلها را برای پردازش هوش مصنوعی دانلود میکند. | Monitor Uploads | Check Document Type | فایلها را از Google Drive برای آمادهسازی جهت تجزیه و تحلیل مبتنی بر هوش مصنوعی دانلود میکند. |
Check Document Type | Google Gemini AI | نوع سند را از ورودی باینری طبقهبندی میکند. | Download File | Download File2 | محتوای سند را برای تعیین نوع آن (مانند رسید، فاکتور) تجزیه و تحلیل میکند. |
Download File2 | Google Drive | فایل را دوباره برای استخراج VLM Run دانلود میکند. | Check Document Type | VLM Run for Extraction | فایل را دوباره دانلود میکند تا اطمینان حاصل شود که دادههای باینری برای نود VLM Run در دسترس هستند. |
VLM Run for Extraction | VLM Run Agent | دادههای ساختاریافته را با استفاده از OCR و طرحبندی استخراج میکند. | Download File2 | Receives Extracted Data (via webhook) | از VLM Run برای استخراج اطلاعات ساختاریافته، از جمله متن و جزئیات طرحبندی، از سند استفاده میکند. |
Receives Extracted Data | Webhook | دادههای JSON استخراجشده را از VLM Run دریافت میکند. | VLM Run for Extraction | AI Agent for Storing Dynamically | بهعنوان یک نقطه پایانی برای دریافت محموله دادههای ساختاریافته از عامل VLM Run عمل میکند. |
AI Agent for Storing Dynamically | LangChain Agent | منطق ذخیرهسازی پویای داده را هماهنگ میکند. | Receives Extracted Data | Get row(s) from sheets, Append row | ذخیرهسازی هوشمند دادههای استخراجشده را مدیریت میکند، Google Sheet صحیح را تعیین کرده و بهروزرسانیهای طرحبندی را مدیریت میکند. |
Get row(s) from sheets | Google Sheets Tool | ردیفهای موجود (سرصفحهها) را از یک صفحه میخواند. | AI Agent for Storing Dynamically | AI Agent for Storing Dynamically | ساختار سرصفحه Google Sheet هدف را قبل از افزودن دادههای جدید تأیید میکند. |
Append row | HTTP Request Tool | ردیفها را از طریق API به Google Sheet اضافه میکند. | AI Agent for Storing Dynamically | ردیفهای جدید، از جمله سرصفحهها در صورت لزوم، را با استفاده از Google Sheets API به Google Sheet تعیینشده اضافه میکند. | |
OpenAI Chat Model | LangChain OpenAI Chat | قابلیتهای هوش مصنوعی را برای LangChain Agent فراهم میکند. | AI Agent for Storing Dynamically | AI Agent for Storing Dynamically | تصمیمگیری و پردازش زبان طبیعی را در عامل هوش مصنوعی تقویت میکند. |
Nodeهای استفادهشده
سوالات متداول
این گردش کار n8n چه کاری انجام میدهد؟▾
این گردش کار اسناد آپلود شده در Google Drive را به طور خودکار پردازش و سازماندهی میکند. از Google Gemini برای طبقهبندی نوع سند و VLM Run برای استخراج دادههای ساختاریافته استفاده میکند و سپس دادهها را بر اساس نوع سند به Google Sheets هدایت میکند.
چه نوع اسنادی را میتوان با این گردش کار پردازش کرد؟▾
این گردش کار برای مدیریت انواع مختلف اسناد مانند رسیدها، رزومهها، ادعاهای درمانی، دستورات پزشک و نقشههای ساختمانی ایدهآل است.
نقش Google Gemini در این گردش کار چیست؟▾
Google Gemini برای طبقهبندی هوشمند نوع هر سند استفاده میشود. این طبقهبندی برای هدایت فرآیندهای بعدی استخراج و ذخیرهسازی دادهها حیاتی است.
VLM Run چه وظیفهای را بر عهده دارد؟▾
VLM Run برای استخراج دادههای ساختاریافته از اسناد به کار میرود. این ابزار با استفاده از قابلیتهای OCR و تحلیل طرحبندی، دادههای مورد نیاز را استخراج میکند.
workflowهای مرتبط
- دستهبندی خودکار ایمیل جیمیل با GPT-4o و هشدار SlackAI Summarization
- دستهبندی خودکار پستهای وبلاگ با هوش مصنوعی و گیتهابContent Creation
- اتوماسیون زیرنویسگذاری ویدیو با n8n، Google Drive و SubmagicContent Creation
- تحلیل خودکار Google Analytics با هوش مصنوعی Gemini و اعلانه…Market Research
- اتوماسیون ثبت رزروهای Calendly در Google Sheets با n8nCRM
- اتوماسیون پیامهای تشکر و کوپن واتساپ برای مشتریان ShopifyContent Creation
