تحلیل هوشمند تصاویر و PDF از گوگل درایو با Gemini 3

تحلیل هوشمند تصاویر و PDF از گوگل درایو با Gemini 3

8 دقیقه مطالعه · منتشر شده ۱۴۰۵/۴/۲۸

دانلود workflow

فایل JSON آماده import در n8n — credentialها باید در n8n شما تنظیم شوند.

  1. فایل JSON را دانلود کنید.
  2. در n8n: Workflows → Import from File.
  3. Credentialهای هر node را متصل کنید.
  4. workflow را فعال کنید.

شناسه workflow: 11038 · منبع: کاتالوگ Axeto

تحلیل تصاویر و PDFها از Google Drive با هوش مصنوعی Gemini 3

این گردش کار، تحلیل و خلاصه‌سازی تصاویر و گزارش‌های مالی PDF جدید آپلود شده در یک پوشه مشخص Google Drive را با استفاده از مدل‌های هوش مصنوعی Google Gemini 3 خودکار می‌کند. این گردش کار برای متخصصان مالی، تحلیلگران یا هر کسی که نیاز به بینش سریع مبتنی بر هوش مصنوعی از داده‌ها و اسناد مالی بصری دارد، طراحی شده است.

مرور گردش کار:

  • دریافت ورودی: پوشه Google Drive تعیین شده را برای آپلود فایل‌های جدید (تصاویر یا PDF) نظارت می‌کند.
  • فیلتر نوع فایل: فایل‌های ورودی را بر اساس نوع MIME جدا می‌کند تا تصاویر و PDFها را به مسیرهای پردازش مربوطه هدایت کند.
  • دانلود فایل: محتوای فایل‌های شناسایی شده را از طریق درخواست‌های HTTP بازیابی می‌کند.
  • تحلیل تصویر: تصاویر دانلود شده را برای تحلیل به مدل Vision Google Gemini 3 ارسال می‌کند، و سپس یک عامل هوش مصنوعی برای خلاصه‌سازی و استخراج بینش‌های کلیدی استفاده می‌شود.
  • استخراج و تحلیل PDF: متن را از PDFها استخراج می‌کند، آن را از طریق OpenRouter به مدل زبان Gemini 3 ارسال می‌کند، و سپس از یک عامل هوش مصنوعی برای خلاصه‌سازی و بینش‌های کلیدی استفاده می‌کند.
  • راهنمایی و مستندات: از Sticky Notes برای دستورالعمل‌ها، بصری‌سازی گردش کار و پیوند به منابع خارجی استفاده می‌کند.

---

تشریح جزئیات گردش کار

۱. دریافت ورودی

  • هدف: تشخیص فایل‌های جدید اضافه شده به پوشه مشخص Google Drive، و راه‌اندازی گردش کار.
  • گره‌ها (Nodes):

* Google Drive Trigger

  • پیکربندی:

* Type: گره Trigger، پیکربندی شده برای گوش دادن به رویدادهای Google Drive.

* Event: fileCreated.

* Folder to watch: شناسه پوشه Google Drive هدف را مشخص کنید.

* Polling: برای بررسی هر دقیقه تنظیم شده است.

* Credential: اطمینان حاصل کنید که اعتبارنامه OAuth Google Drive شما دسترسی خواندن به پوشه مشخص شده را دارد.

  • ورودی: ندارد (رویداد محور).
  • خروجی: متادیتای JSON فایل(های) جدید آپلود شده.
  • مشکلات احتمالی: خطاهای اعتبارنامه OAuth، مجوزهای ناکافی پوشه، محدودیت‌های نرخ API.

۲. فیلتر نوع فایل

  • هدف: مسیریابی فایل‌ها به شاخه‌های پردازش مختلف بر اساس نوع MIME آن‌ها، و تمایز بین تصاویر و PDFها.
  • گره‌ها (Nodes):

* If (با نام "Filter by Type")

  • پیکربندی:

* Type: گره منطق شرطی.

* Condition: بررسی می‌کند که آیا نوع MIME فایل image/png یا image/webp است.

  • ورودی: متادیتای فایل از Google Drive Trigger.
  • خروجی:

* Output 1: اگر نوع MIME با فرمت تصویر مطابقت داشته باشد.

* Output 2 (Else): برای سایر انواع فایل‌ها، که در این گردش کار فرض می‌شود PDF هستند.

  • مشکلات احتمالی: انواع MIME گمشده یا غیرمنتظره؛ فرمت‌های فایل پشتیبانی نشده نادیده گرفته خواهند شد.

۳. دانلود فایل

  • هدف: دانلود محتوای واقعی فایل از Google Drive با استفاده از پیوند محتوای وب آن، و آماده‌سازی آن برای تحلیل.
  • گره‌ها (Nodes):

* HTTP Request (با نام "Download Image")

* HTTP Request (با نام "Download PDF")

  • پیکربندی:

* Type: گره HTTP Request.

* URL: از webContentLink از متادیتای فایل استفاده می‌کند.

  • ورودی: متادیتای فایل از گره If (مخصوص شاخه تصویر یا PDF).
  • خروجی: داده‌های باینری تصویر یا PDF دانلود شده.
  • مشکلات احتمالی: URL نامعتبر، خطاهای مجوز، خرابی‌های اتصال شبکه.

۴. شاخه تحلیل تصویر

  • هدف: تحلیل تصاویر دانلود شده (مانند نمودارها، دیاگرام‌ها) با استفاده از هوش مصنوعی Google Gemini 3 Vision و خلاصه‌سازی یافته‌ها.
  • گره‌ها (Nodes):

* Google Gemini (با نام "Analyze an image")

* Agent (با نام "Analyzer Agent")

  • پیکربندی:

* Analyze an image:

* Type: گره LangChain Google Gemini (مدل Vision).

* Model: models/gemini-3-pro-preview.

* Operation: تحلیل ورودی تصویر (باینری).

* Text Prompt: "این گزارش/تصویر را خلاصه کن."

* Analyzer Agent:

* Type: گره LangChain Agent.

* Input Text: $json.content.parts[0].text (از گره "Analyze an image").

* System Message: پیکربندی شده برای عمل به عنوان دستیار تحلیلگر مالی، خلاصه‌سازی و استخراج ۳ یافته کلیدی برتر.

  • ورودی:

* "Analyze an image": داده‌های باینری تصویر از "Download Image".

* "Analyzer Agent": نتایج تحلیل JSON از "Analyze an image".

  • خروجی:

* "Analyze an image": JSON حاوی تفسیر متنی و بصری تصویر.

* "Analyzer Agent": خلاصه‌ای از یافته‌های کلیدی از تحلیل تصویر.

  • مشکلات احتمالی: مشکلات اعتبارنامه API، در دسترس بودن مدل، فرمت‌های تصویر پشتیبانی نشده، تأخیر یا خطاهای مدل هوش مصنوعی، خطاهای تجزیه (parsing).

۵. شاخه استخراج و تحلیل PDF

  • هدف: استخراج متن از فایل‌های PDF، پردازش آن با Gemini 3 از طریق OpenRouter، و خلاصه‌سازی محتوا با استفاده از یک عامل هوش مصنوعی.
  • گره‌ها (Nodes):

* Extract from File

* OpenRouter Chat Model (با نام "OpenRouter Chat Model1")

* Agent (با نام "Analyzer Agent (PDF)")

  • پیکربندی:

* Extract from File:

* Type: گره ExtractFromFile.

* Configuration: محتوای متنی را از PDF باینری استخراج می‌کند.

* OpenRouter Chat Model1:

* Type: گره LangChain OpenRouter Chat Model.

* Model: google/gemini-3-pro-preview.

* Input: از متن استخراج شده از گره "Extract from File" استفاده می‌کند.

* Analyzer Agent (PDF):

* Type: گره LangChain Agent.

* Input Text: $json.content.parts[0].text (از "OpenRouter Chat Model1").

* System Message: همان اعلان دستیار تحلیلگر مالی که در شاخه تحلیل تصویر استفاده شده است.

  • ورودی:

* "Extract from File": داده‌های باینری PDF از "Download PDF".

* "OpenRouter Chat Model1": متن استخراج شده از "Extract from File".

* "Analyzer Agent (PDF)": متن پردازش شده از "OpenRouter Chat Model1".

  • خروجی:

* "Extract from File": محتوای متنی استخراج شده (JSON).

* "OpenRouter Chat Model1": متن پردازش شده آماده برای عامل هوش مصنوعی.

* "Analyzer Agent (PDF)": گزارش خلاصه‌شده با بینش‌های کلیدی از PDF.

  • مشکلات احتمالی: PDFهای بدون متن قابل انتخاب (فقط تصاویر اسکن شده)، خرابی استخراج، محدودیت‌های API، مشکلات اتصال، خطاهای اعتبارنامه، مشکلات تجزیه متن، خطاهای مدل هوش مصنوعی.

۶. راهنمایی و مستندات کاربر

  • هدف: ارائه زمینه، برچسب‌گذاری بخش‌های گردش کار و ارائه پیوند به منابع خارجی برای درک و آشنایی کاربر.
  • گره‌ها (Nodes):

* Sticky Note (نمونه‌های متعدد)

  • پیکربندی: این گره‌ها برای حاشیه‌نویسی بصری استفاده می‌شوند و حاوی توضیحات، دستورالعمل‌ها، تقسیم‌بندی گردش کار و پیوند به آموزش‌های ویدیویی خارجی هستند.
  • ورودی/خروجی: ندارد.

---

جدول خلاصه

نام گره (Node Name)نوع گره (Node Type)نقش عملکردی (Functional Role)گره(های) ورودی (Input Node(s))گره(های) خروجی (Output Node(s))یادداشت چسبان مرتبط (Associated Sticky Note)
Google Drive TriggerGoogle Drive Triggerتشخیص فایل‌های جدید در پوشه DriveFilter by TypeDrive Trigger + Filter by type
Filter by TypeIfمسیریابی فایل‌ها بر اساس نوع MIMEGoogle Drive TriggerDownload Image, Download PDFDrive Trigger + Filter by type
Download ImageHTTP Requestدانلود فایل تصویر از URLFilter by Type (image)Analyze an imageImage Analyzer
Analyze an imageLangChain Google Gemini (Vision)تحلیل محتوای تصویر با Gemini 3Download ImageAnalyzer AgentImage Analyzer
Analyzer AgentLangChain Agentخلاصه‌سازی خروجی تحلیل تصویرAnalyze an imageImage Analyzer
Download PDFHTTP Requestدانلود فایل PDF از URLFilter by Type (PDF)Extract from FilePDF Extractor & Analyzer
Extract from FileExtractFromFileاستخراج متن از PDF دانلود شدهDownload PDFAnalyzer Agent (PDF)PDF Extractor & Analyzer
OpenRouter Chat Model1LangChain OpenRouter Chat Modelپردازش متن PDF استخراج شده با Gemini 3Extract from FileAnalyzer Agent (PDF)PDF Extractor & Analyzer
Analyzer Agent (PDF)LangChain Agentخلاصه‌سازی خروجی تحلیل متن PDFOpenRouter Chat Model1PDF Extractor & Analyzer
Sticky Note (Image)Sticky Noteحاشیه‌نویسی بصری برای شاخه تصویرImage Analyzer
Sticky Note1 (PDF)Sticky Noteحاشیه‌نویسی بصری برای شاخه PDFPDF Extractor & Analyzer
Sticky Note2 (Filter)Sticky Noteحاشیه‌نویسی بصری برای Trigger/فیلترDrive Trigger + Filter by type
Sticky Note3 (Overview)Sticky Noteتوضیحات و راهنمای راه‌اندازی گردش کار کاملGemini 3 Image & PDF Extractor overview and setup guide
Sticky Note4 (Video)Sticky Noteپیوند آموزش ویدیویی یوتیوبLink to video tutorial: https://www.youtube.com/watch?v=UuWYT_uXiw0

---

بازسازی گردش کار

برای بازسازی این گردش کار از ابتدا:

1. افزودن گره Google Drive Trigger:

* Type: Google Drive Trigger

* Event: fileCreated

* Folder to watch: شناسه پوشه Google Drive خاص خود را وارد کنید.

* Polling: روی 1 minute تنظیم کنید.

* Credential: اعتبارنامه OAuth Google Drive خود را با مجوزهای خواندن برای پوشه هدف انتخاب کنید.

2. افزودن گره If (Filter by Type):

* Type: If

* Conditions:

* {{ $json.mimeType }} equals image/png

* OR

* {{ $json.mimeType }} equals image/webp

Nodeهای استفاده‌شده

سوالات متداول

این گردش کار چگونه تصاویر و PDFها را در گوگل درایو تحلیل می‌کند؟

این گردش کار با نظارت بر یک پوشه مشخص در گوگل درایو، فایل‌های جدید را شناسایی کرده و سپس با استفاده از مدل‌های هوش مصنوعی Google Gemini 3، محتوای تصاویر و متن PDFها را استخراج و تحلیل می‌کند تا بینش‌های کلیدی را خلاصه نماید.

چه نوع فایل‌هایی توسط این گردش کار پشتیبانی می‌شوند؟

این گردش کار به طور خاص برای تحلیل تصاویر (مانند PNG و WebP) و فایل‌های PDF طراحی شده است. فایل‌های دیگر ممکن است نادیده گرفته شوند یا به درستی پردازش نشوند.

مزایای استفاده از این گردش کار برای تحلیل مالی چیست؟

این گردش کار فرآیند تحلیل گزارش‌های مالی و داده‌های بصری را خودکار می‌کند، به شما امکان می‌دهد تا به سرعت بینش‌های کلیدی را استخراج کرده و در زمان صرفه‌جویی کنید، که برای تصمیم‌گیری‌های مالی سریع‌تر بسیار مفید است.

workflowهای مرتبط

این workflow در کاتالوگ Axeto.ai بایگانی شده است. لایسنس اصلی متعلق به سازنده workflow است.

    تحلیل هوشمند تصاویر و PDF از گوگل درایو با Gemini 3 | Axeto.ai