
تحلیل هوشمند تصاویر و PDF از گوگل درایو با Gemini 3
8 دقیقه مطالعه · منتشر شده ۱۴۰۵/۴/۲۸
دانلود workflow
فایل JSON آماده import در n8n — credentialها باید در n8n شما تنظیم شوند.
- فایل JSON را دانلود کنید.
- در n8n: Workflows → Import from File.
- Credentialهای هر node را متصل کنید.
- workflow را فعال کنید.
شناسه workflow: 11038 · منبع: کاتالوگ Axeto
تحلیل تصاویر و PDFها از Google Drive با هوش مصنوعی Gemini 3
این گردش کار، تحلیل و خلاصهسازی تصاویر و گزارشهای مالی PDF جدید آپلود شده در یک پوشه مشخص Google Drive را با استفاده از مدلهای هوش مصنوعی Google Gemini 3 خودکار میکند. این گردش کار برای متخصصان مالی، تحلیلگران یا هر کسی که نیاز به بینش سریع مبتنی بر هوش مصنوعی از دادهها و اسناد مالی بصری دارد، طراحی شده است.
مرور گردش کار:
- دریافت ورودی: پوشه Google Drive تعیین شده را برای آپلود فایلهای جدید (تصاویر یا PDF) نظارت میکند.
- فیلتر نوع فایل: فایلهای ورودی را بر اساس نوع MIME جدا میکند تا تصاویر و PDFها را به مسیرهای پردازش مربوطه هدایت کند.
- دانلود فایل: محتوای فایلهای شناسایی شده را از طریق درخواستهای HTTP بازیابی میکند.
- تحلیل تصویر: تصاویر دانلود شده را برای تحلیل به مدل Vision Google Gemini 3 ارسال میکند، و سپس یک عامل هوش مصنوعی برای خلاصهسازی و استخراج بینشهای کلیدی استفاده میشود.
- استخراج و تحلیل PDF: متن را از PDFها استخراج میکند، آن را از طریق OpenRouter به مدل زبان Gemini 3 ارسال میکند، و سپس از یک عامل هوش مصنوعی برای خلاصهسازی و بینشهای کلیدی استفاده میکند.
- راهنمایی و مستندات: از Sticky Notes برای دستورالعملها، بصریسازی گردش کار و پیوند به منابع خارجی استفاده میکند.
---
تشریح جزئیات گردش کار
۱. دریافت ورودی
- هدف: تشخیص فایلهای جدید اضافه شده به پوشه مشخص Google Drive، و راهاندازی گردش کار.
- گرهها (Nodes):
* Google Drive Trigger
- پیکربندی:
* Type: گره Trigger، پیکربندی شده برای گوش دادن به رویدادهای Google Drive.
* Event: fileCreated.
* Folder to watch: شناسه پوشه Google Drive هدف را مشخص کنید.
* Polling: برای بررسی هر دقیقه تنظیم شده است.
* Credential: اطمینان حاصل کنید که اعتبارنامه OAuth Google Drive شما دسترسی خواندن به پوشه مشخص شده را دارد.
- ورودی: ندارد (رویداد محور).
- خروجی: متادیتای JSON فایل(های) جدید آپلود شده.
- مشکلات احتمالی: خطاهای اعتبارنامه OAuth، مجوزهای ناکافی پوشه، محدودیتهای نرخ API.
۲. فیلتر نوع فایل
- هدف: مسیریابی فایلها به شاخههای پردازش مختلف بر اساس نوع MIME آنها، و تمایز بین تصاویر و PDFها.
- گرهها (Nodes):
* If (با نام "Filter by Type")
- پیکربندی:
* Type: گره منطق شرطی.
* Condition: بررسی میکند که آیا نوع MIME فایل image/png یا image/webp است.
- ورودی: متادیتای فایل از
Google Drive Trigger. - خروجی:
* Output 1: اگر نوع MIME با فرمت تصویر مطابقت داشته باشد.
* Output 2 (Else): برای سایر انواع فایلها، که در این گردش کار فرض میشود PDF هستند.
- مشکلات احتمالی: انواع MIME گمشده یا غیرمنتظره؛ فرمتهای فایل پشتیبانی نشده نادیده گرفته خواهند شد.
۳. دانلود فایل
- هدف: دانلود محتوای واقعی فایل از Google Drive با استفاده از پیوند محتوای وب آن، و آمادهسازی آن برای تحلیل.
- گرهها (Nodes):
* HTTP Request (با نام "Download Image")
* HTTP Request (با نام "Download PDF")
- پیکربندی:
* Type: گره HTTP Request.
* URL: از webContentLink از متادیتای فایل استفاده میکند.
- ورودی: متادیتای فایل از گره
If(مخصوص شاخه تصویر یا PDF). - خروجی: دادههای باینری تصویر یا PDF دانلود شده.
- مشکلات احتمالی: URL نامعتبر، خطاهای مجوز، خرابیهای اتصال شبکه.
۴. شاخه تحلیل تصویر
- هدف: تحلیل تصاویر دانلود شده (مانند نمودارها، دیاگرامها) با استفاده از هوش مصنوعی Google Gemini 3 Vision و خلاصهسازی یافتهها.
- گرهها (Nodes):
* Google Gemini (با نام "Analyze an image")
* Agent (با نام "Analyzer Agent")
- پیکربندی:
* Analyze an image:
* Type: گره LangChain Google Gemini (مدل Vision).
* Model: models/gemini-3-pro-preview.
* Operation: تحلیل ورودی تصویر (باینری).
* Text Prompt: "این گزارش/تصویر را خلاصه کن."
* Analyzer Agent:
* Type: گره LangChain Agent.
* Input Text: $json.content.parts[0].text (از گره "Analyze an image").
* System Message: پیکربندی شده برای عمل به عنوان دستیار تحلیلگر مالی، خلاصهسازی و استخراج ۳ یافته کلیدی برتر.
- ورودی:
* "Analyze an image": دادههای باینری تصویر از "Download Image".
* "Analyzer Agent": نتایج تحلیل JSON از "Analyze an image".
- خروجی:
* "Analyze an image": JSON حاوی تفسیر متنی و بصری تصویر.
* "Analyzer Agent": خلاصهای از یافتههای کلیدی از تحلیل تصویر.
- مشکلات احتمالی: مشکلات اعتبارنامه API، در دسترس بودن مدل، فرمتهای تصویر پشتیبانی نشده، تأخیر یا خطاهای مدل هوش مصنوعی، خطاهای تجزیه (parsing).
۵. شاخه استخراج و تحلیل PDF
- هدف: استخراج متن از فایلهای PDF، پردازش آن با Gemini 3 از طریق OpenRouter، و خلاصهسازی محتوا با استفاده از یک عامل هوش مصنوعی.
- گرهها (Nodes):
* Extract from File
* OpenRouter Chat Model (با نام "OpenRouter Chat Model1")
* Agent (با نام "Analyzer Agent (PDF)")
- پیکربندی:
* Extract from File:
* Type: گره ExtractFromFile.
* Configuration: محتوای متنی را از PDF باینری استخراج میکند.
* OpenRouter Chat Model1:
* Type: گره LangChain OpenRouter Chat Model.
* Model: google/gemini-3-pro-preview.
* Input: از متن استخراج شده از گره "Extract from File" استفاده میکند.
* Analyzer Agent (PDF):
* Type: گره LangChain Agent.
* Input Text: $json.content.parts[0].text (از "OpenRouter Chat Model1").
* System Message: همان اعلان دستیار تحلیلگر مالی که در شاخه تحلیل تصویر استفاده شده است.
- ورودی:
* "Extract from File": دادههای باینری PDF از "Download PDF".
* "OpenRouter Chat Model1": متن استخراج شده از "Extract from File".
* "Analyzer Agent (PDF)": متن پردازش شده از "OpenRouter Chat Model1".
- خروجی:
* "Extract from File": محتوای متنی استخراج شده (JSON).
* "OpenRouter Chat Model1": متن پردازش شده آماده برای عامل هوش مصنوعی.
* "Analyzer Agent (PDF)": گزارش خلاصهشده با بینشهای کلیدی از PDF.
- مشکلات احتمالی: PDFهای بدون متن قابل انتخاب (فقط تصاویر اسکن شده)، خرابی استخراج، محدودیتهای API، مشکلات اتصال، خطاهای اعتبارنامه، مشکلات تجزیه متن، خطاهای مدل هوش مصنوعی.
۶. راهنمایی و مستندات کاربر
- هدف: ارائه زمینه، برچسبگذاری بخشهای گردش کار و ارائه پیوند به منابع خارجی برای درک و آشنایی کاربر.
- گرهها (Nodes):
* Sticky Note (نمونههای متعدد)
- پیکربندی: این گرهها برای حاشیهنویسی بصری استفاده میشوند و حاوی توضیحات، دستورالعملها، تقسیمبندی گردش کار و پیوند به آموزشهای ویدیویی خارجی هستند.
- ورودی/خروجی: ندارد.
---
جدول خلاصه
| نام گره (Node Name) | نوع گره (Node Type) | نقش عملکردی (Functional Role) | گره(های) ورودی (Input Node(s)) | گره(های) خروجی (Output Node(s)) | یادداشت چسبان مرتبط (Associated Sticky Note) |
|---|---|---|---|---|---|
| Google Drive Trigger | Google Drive Trigger | تشخیص فایلهای جدید در پوشه Drive | — | Filter by Type | Drive Trigger + Filter by type |
| Filter by Type | If | مسیریابی فایلها بر اساس نوع MIME | Google Drive Trigger | Download Image, Download PDF | Drive Trigger + Filter by type |
| Download Image | HTTP Request | دانلود فایل تصویر از URL | Filter by Type (image) | Analyze an image | Image Analyzer |
| Analyze an image | LangChain Google Gemini (Vision) | تحلیل محتوای تصویر با Gemini 3 | Download Image | Analyzer Agent | Image Analyzer |
| Analyzer Agent | LangChain Agent | خلاصهسازی خروجی تحلیل تصویر | Analyze an image | — | Image Analyzer |
| Download PDF | HTTP Request | دانلود فایل PDF از URL | Filter by Type (PDF) | Extract from File | PDF Extractor & Analyzer |
| Extract from File | ExtractFromFile | استخراج متن از PDF دانلود شده | Download PDF | Analyzer Agent (PDF) | PDF Extractor & Analyzer |
| OpenRouter Chat Model1 | LangChain OpenRouter Chat Model | پردازش متن PDF استخراج شده با Gemini 3 | Extract from File | Analyzer Agent (PDF) | PDF Extractor & Analyzer |
| Analyzer Agent (PDF) | LangChain Agent | خلاصهسازی خروجی تحلیل متن PDF | OpenRouter Chat Model1 | — | PDF Extractor & Analyzer |
| Sticky Note (Image) | Sticky Note | حاشیهنویسی بصری برای شاخه تصویر | — | — | Image Analyzer |
| Sticky Note1 (PDF) | Sticky Note | حاشیهنویسی بصری برای شاخه PDF | — | — | PDF Extractor & Analyzer |
| Sticky Note2 (Filter) | Sticky Note | حاشیهنویسی بصری برای Trigger/فیلتر | — | — | Drive Trigger + Filter by type |
| Sticky Note3 (Overview) | Sticky Note | توضیحات و راهنمای راهاندازی گردش کار کامل | — | — | Gemini 3 Image & PDF Extractor overview and setup guide |
| Sticky Note4 (Video) | Sticky Note | پیوند آموزش ویدیویی یوتیوب | — | — | Link to video tutorial: https://www.youtube.com/watch?v=UuWYT_uXiw0 |
---
بازسازی گردش کار
برای بازسازی این گردش کار از ابتدا:
1. افزودن گره Google Drive Trigger:
* Type: Google Drive Trigger
* Event: fileCreated
* Folder to watch: شناسه پوشه Google Drive خاص خود را وارد کنید.
* Polling: روی 1 minute تنظیم کنید.
* Credential: اعتبارنامه OAuth Google Drive خود را با مجوزهای خواندن برای پوشه هدف انتخاب کنید.
2. افزودن گره If (Filter by Type):
* Type: If
* Conditions:
* {{ $json.mimeType }} equals image/png
* OR
* {{ $json.mimeType }} equals image/webp
Nodeهای استفادهشده
سوالات متداول
این گردش کار چگونه تصاویر و PDFها را در گوگل درایو تحلیل میکند؟▾
این گردش کار با نظارت بر یک پوشه مشخص در گوگل درایو، فایلهای جدید را شناسایی کرده و سپس با استفاده از مدلهای هوش مصنوعی Google Gemini 3، محتوای تصاویر و متن PDFها را استخراج و تحلیل میکند تا بینشهای کلیدی را خلاصه نماید.
چه نوع فایلهایی توسط این گردش کار پشتیبانی میشوند؟▾
این گردش کار به طور خاص برای تحلیل تصاویر (مانند PNG و WebP) و فایلهای PDF طراحی شده است. فایلهای دیگر ممکن است نادیده گرفته شوند یا به درستی پردازش نشوند.
مزایای استفاده از این گردش کار برای تحلیل مالی چیست؟▾
این گردش کار فرآیند تحلیل گزارشهای مالی و دادههای بصری را خودکار میکند، به شما امکان میدهد تا به سرعت بینشهای کلیدی را استخراج کرده و در زمان صرفهجویی کنید، که برای تصمیمگیریهای مالی سریعتر بسیار مفید است.
workflowهای مرتبط
- تحلیل خودکار مناقصهها با n8n، LlamaParse و GeminiDocument Extraction
- طبقهبندی خودکار حوادث امنیتی با GPT-4 و Google SheetsSecOps
- دستهبندی خودکار ایمیل جیمیل با GPT-4o و هشدار SlackAI Summarization
- دستهبندی خودکار پستهای وبلاگ با هوش مصنوعی و گیتهابContent Creation
- خودکارسازی اصلاح نقطه پایانی با Wazuh، ClamAV و GPT-4SecOps
- تغییر نام خودکار گرههای n8n با هوش مصنوعیEngineering
