خودکارسازی رونویسی و خلاصه‌سازی صدا با n8n و هوش مصنوعی

خودکارسازی رونویسی و خلاصه‌سازی صدا با n8n و هوش مصنوعی

4 دقیقه مطالعه · منتشر شده ۱۴۰۵/۵/۷

دانلود workflow

فایل JSON آماده import در n8n — credentialها باید در n8n شما تنظیم شوند.

  1. فایل JSON را دانلود کنید.
  2. در n8n: Workflows → Import from File.
  3. Credentialهای هر node را متصل کنید.
  4. workflow را فعال کنید.

شناسه workflow: 8639 · منبع: کاتالوگ Pixori

تبدیل صدا به خلاصه اجرایی: رونویسی و تحلیل با AssemblyAI و GPT-4

این گردش کار فرآیند تبدیل فایل‌های صوتی به خلاصه‌های اجرایی دقیق را خودکار می‌کند. این برنامه برای کاربرانی طراحی شده است که نیاز دارند با رونویسی صدا و تحلیل محتوای آن با هوش مصنوعی، به سرعت بینش‌های عملی از جلسات، سخنرانی‌ها یا پادکست‌ها استخراج کنند.

این گردش کار دو روش ورودی اصلی را پشتیبانی می‌کند:

  • ارسال فرم با بارگذاری فایل صوتی محلی: کاربران می‌توانند مستقیماً یک فایل صوتی را از طریق یک فرم وب بارگذاری کنند.
  • ارسال فرم با لینک صوتی Google Drive: کاربران می‌توانند لینکی به یک فایل صوتی ذخیره شده در Google Drive ارائه دهند.

پس از دریافت ورودی صوتی، گردش کار مراحل اصلی زیر را طی می‌کند:

1. آماده‌سازی صدا و درخواست رونویسی: فایل صوتی به AssemblyAI بارگذاری می‌شود و یک کار رونویسی آغاز می‌گردد.

2. نظرسنجی و بازیابی رونویسی: گردش کار به طور مکرر وضعیت AssemblyAI را بررسی می‌کند تا زمانی که رونویسی کامل شود، سپس متن رونویسی شده را بازیابی می‌کند.

3. تحلیل هوش مصنوعی و ارسال ایمیل: رونویسی به GPT-4 اوپن‌ای‌آی برای تحلیل ساختاریافته ارسال می‌شود و خلاصه‌ای، احساسات، نکات کلیدی، موارد اقدام، نقل قول‌ها و موضوعات را تولید می‌کند. سپس نتایج در قالب یک ایمیل HTML قالب‌بندی شده و از طریق جیمیل به کاربر ارسال می‌شود.

عناصر پشتیبان شامل یادداشت‌های چسبان برای مستندسازی، منطق شرطی برای مدیریت خطا و پایان تمیز گردش کار است.

---

جزئیات گردش کار

۱. دریافت ورودی: ارسال فرم و آماده‌سازی فایل

این بخش ورودی کاربر را از طریق فرم‌های وب مدیریت می‌کند و از بارگذاری مستقیم فایل محلی و لینک‌های Google Drive پشتیبانی می‌کند.

  • فرم تریگر (لینک Google Drive):

* نوع: formTrigger

* نقش: جمع‌آوری URL فایل صوتی Google Drive و آدرس ایمیل گیرنده.

* پیکربندی: فیلدهای فرم شامل "نام فایل صوتی"، "آدرس URL/لینک فایل صوتی را ارائه دهید" و "ایمیل" (الزامی) است.

* خروجی: داده‌های فرم، از جمله URL Google Drive.

* نکته: ### Execution flow Form submission + Google Drive link<br>#### Receive Google Drive Link

  • کد (استخراج شناسه فایل):

* نوع: code

* نقش: تجزیه URL Google Drive برای استخراج شناسه منحصر به فرد فایل با استفاده از یک عبارت منظم.

* عبارت کلیدی: عبارت منظم مطابق با /\/d\/|id=([A-Za-z0-9_-]{20,})/

* ورودی: URL Google Drive از تریگر فرم.

* خروجی: JSON حاوی fileId استخراج شده.

* نکته: در صورت نامعتبر بودن فرمت URL، خطاهای احتمالی را مدیریت می‌کند.

  • نود Google Drive (دریافت فایل):

* نوع: googleDrive

* نقش: دانلود فایل صوتی از Google Drive با استفاده از fileId استخراج شده.

* پیکربندی: عملیات روی "دانلود" تنظیم شده است.

* اعتبارنامه‌ها: نیاز به اعتبارنامه‌های OAuth2 پیکربندی شده Google Drive دارد.

* ورودی: fileId از نود کد.

* خروجی: داده‌های باینری فایل صوتی، آماده برای بارگذاری در AssemblyAI.

* نکته: خطاهای احتمالی مجوز یا سناریوهای عدم یافتن فایل را مدیریت می‌کند.

* نکته: ### Assembly AI

  • فرم تریگر (بارگذاری فایل محلی):

* نوع: formTrigger

* نقش: جمع‌آوری بارگذاری فایل صوتی محلی (مانند .MP4) و آدرس ایمیل گیرنده.

* پیکربندی: فیلدها شامل "نام فایل صوتی"، یک فیلد بارگذاری فایل و "ایمیل" (همه الزامی) است.

* خروجی: داده‌های باینری فایل صوتی و فراداده‌های مرتبط.

* نکته: ### Execution flow Form submission + Local file<br>#### Upload an audio file

۲. بارگذاری صدا و درخواست رونویسی به AssemblyAI

این بخش بارگذاری داده‌های صوتی به AssemblyAI و شروع فرآیند رونویسی را مدیریت می‌کند.

  • HTTP Request (بارگذاری در AssemblyAI - Google Drive):

* نوع: httpRequest

* نقش: بارگذاری داده‌های باینری صدا (دانلود شده از Google Drive) به نقطه پایانی بارگذاری AssemblyAI.

* پیکربندی:

* متد: POST

* URL: https://api.assemblyai.com/v2/upload

* هدرها: Authorization با کلید API AssemblyAI شما.

* بدنه: داده‌های باینری خام فایل صوتی.

* ورودی: فایل صوتی باینری از نود Google Drive.

* خروجی: پاسخ JSON حاوی upload_url برای فایل صوتی.

* نکته: مسائل احتمالی کلید API، مهلت‌های زمانی شبکه یا خرابی بارگذاری فایل‌های بزرگ را مدیریت می‌کند.

* نکته: ### Assembly AI

  • HTTP Request (بارگذاری در AssemblyAI - بارگذاری محلی):

* نوع: httpRequest

* نقش: بارگذاری داده‌های باینری صدا از فرم بارگذاری فایل محلی به AssemblyAI.

* پیکربندی: مشابه بارگذاری Google Drive، اطمینان از استفاده از ویژگی باینری ورودی صحیح.

* ورودی: فایل صوتی باینری از تریگر فرم بارگذاری فایل محلی.

* خروجی: پاسخ JSON حاوی upload_url.

* نکته: ### Assembly AI

  • HTTP Request (درخواست رونویسی - Google Drive):

* نوع: httpRequest

* نقش: ارسال درخواست به AssemblyAI برای شروع فرآیند رونویسی برای صدای بارگذاری شده.

* پیکربندی:

* متد: POST

* URL: https://api.assemblyai.com/v2/transcript

* هدرها: Authorization با کلید API AssemblyAI شما.

* بدنه (JSON): {"audio_url": "{{$json.upload_url}}", "speaker_labels": false, "auto_highlights": true, "punctuate": true}

* ورودی: upload_url از نود بارگذاری AssemblyAI.

* خروجی:

Nodeهای استفاده‌شده

سوالات متداول

این گردش کار n8n چه کاری انجام می‌دهد؟

این گردش کار فایل‌های صوتی را به طور خودکار رونویسی کرده و سپس با استفاده از هوش مصنوعی (GPT-4) خلاصه‌های اجرایی، نکات کلیدی، موارد اقدام و احساسات را از محتوای صوتی استخراج می‌کند و نتایج را از طریق ایمیل ارسال می‌نماید.

چه روش‌هایی برای ورود فایل صوتی پشتیبانی می‌شود؟

این گردش کار دو روش اصلی را پشتیبانی می‌کند: بارگذاری مستقیم فایل صوتی از طریق یک فرم وب، و ارائه لینک فایل صوتی ذخیره شده در Google Drive.

کدام ابزارها در این گردش کار استفاده شده‌اند؟

این گردش کار از n8n به عنوان پلتفرم اتوماسیون، AssemblyAI برای رونویسی صدا و GPT-4 (اوپن‌ای‌آی) برای تحلیل و خلاصه‌سازی متن استفاده می‌کند. همچنین از Gmail برای ارسال نتایج بهره می‌برد.

چگونه می‌توانم این گردش کار را تنظیم کنم؟

برای تنظیم این گردش کار، نیاز به حساب‌های کاربری در n8n، AssemblyAI و OpenAI دارید. باید کلیدهای API مربوطه را در تنظیمات نودهای مربوطه وارد کرده و گردش کار را در پلتفرم n8n خود پیاده‌سازی کنید.

workflowهای مرتبط

این workflow در کاتالوگ Pixori.me بایگانی شده است. لایسنس اصلی متعلق به سازنده workflow است.