مرجع تخصصی اتوماسیون با n8n و ابزارهای هوش مصنوعی
آموزش‌های گام‌به‌گام، سناریوهای کاملاً تست‌شده و راهکارهای هوشمندسازی فرایندها برای افزایش سرعت و دقت در کارهای روزمره و کسب‌وکار.
معماری سیستم

آموزش بر پایه سناریوهای واقعی، نه تئوری!

گام ۰۱ // TRIGGER

دریافت و اتصال خودکار داده‌ها

دریافت مستقیم اطلاعات از وب‌هوک‌ها، فرم‌ها، ایمیل‌ها یا سیستم‌های CRM و ورود آنی داده‌ها به جریان اتوماسیون.

  • اتصال بدون محدودیت به سرویس‌های ایرانی و خارجی
  • پردازش آنی داده‌های ورودی (Real-time Webhook)
POST /api/v1/n8n-webhook
// Event Listening...
{
  "event": "lead_captured",
  "source": "WordPress_Form"
}
گام ۰۲ // AI PROCESSING

پردازش هوشمند با مدل‌های AI

ارسال داده‌ها به ایجنت‌ها و مدل‌های پردازشی (GPT-4o, Claude) جهت تحلیل متن، خلاصه‌سازی و تصمیم‌گیری هوشمند.

  • استفاده از پرامپت‌های مهندسی‌شده و دقیق
  • استخراج داده‌های ساختاریافته (JSON Output)
AI_Agent.analyze({
  model: "gpt-4o",
  temperature: 0.2,
  status: "ANALYSIS_SUCCESSFUL"
});
گام ۰۳ // AUTOMATION EXECUTION

اجرای خودکار در n8n

ارسال خروجی تحلیل‌شده به پیام‌رسان‌ها، دیتابیس، پنل‌های مدیریتی یا ارسال ایمیل بدون نیاز به دخالت انسانی.

  • کاهش ۹۰ درصدی خطای انسانی در فرایندها
  • اجرای تمام‌خودکار و ۲۴/۷ سناریوها
Workflow.execute();
✓ Notification sent to Telegram
✓ Row inserted into Database

خودکارسازی اسکرپ سایت با n8n

انتشار خودکار محتوا با n8n

مقدمه

خودکارسازی اسکرپ سایت با n8n : 

N8Nابزاری است که به کمک آن می توانید در مدت‌زمان کوتاهی، فرایندهای خود را با هوش مصنوعی خودکار کنید و از مزایای اتوماسیون هوشمند بهره‌ مند شوید.

N8N برای چه کسب و کارهایی مناسب است:

اگر سازمان شما کوچک می باشد و هم اکنون بسیاری از کار های خود را با نرم افزار هایی همچون اکسل انجام می دهید، N8N برای کسب و کار شما ایده آل است و در صورتی که کسب و کاری متوسط یا بزرگ دارید می توانید بخش های بسیاری از فرایند های غیر کلیدی خود را با این ابزار هوشمند کنید.

اگر به پیاده‌سازی اختصاصی، اتصال n8n به نرم‌افزارهای سازمانی یا سفارشی‌سازی Workflowها متناسب با کسب‌وکارتان نیاز دارید، Danix با بررسی نیازهای کسب‌وکار شما، می‌تواند این فرایند را از طراحی تا استقرار برای شما انجام دهیم.

همچنین اگر ترجیح می‌دهید شخصاً نصب و راه‌اندازی را انجام دهید، می‌توانید از اطلاعات موجود در مقالات، دسته N8N استفاده کنید .همچنین می توانید template موجود در این workflow را به صورت رایگان از این قسمت دانلود کنید.

خودکارسازی اسکرپ سایت با n8n

خودکارسازی خزش وب‌سایت با هوش مصنوعی در n8n یکی از کاربردی‌ترین سناریوهای اتوماسیون در حوزه جمع‌آوری داده‌های وب است. در بسیاری از کسب‌وکارها، نیاز به استخراج اطلاعات تماس، لینک‌های شبکه‌های اجتماعی یا سایر داده‌های عمومی از وب‌سایت‌های مختلف وجود دارد. انجام دستی این فرآیند برای تعداد زیادی وب‌سایت، زمان‌بر و هزینه‌بر است. با استفاده از n8n و قابلیت‌های هوش مصنوعی OpenAI، می‌توان یک خزنده خودکار ایجاد کرد که وب‌سایت‌ها را مرور کند، محتوا را تحلیل کند و داده‌های مورد نیاز را به‌صورت ساختاریافته استخراج نماید.

این Workflow با دریافت لیست شرکت‌ها از یک پایگاه داده، وب‌سایت هر شرکت را خزش می‌کند و لینک‌های شبکه‌های اجتماعی آن را شناسایی و Agent داده‌ها را بازیابی کرده و در قالب JSON یکپارچه برمی‌گرداند سپس Workflow نتایج استخراج‌شده را در جدول خروجی پایگاه داده ذخیره می‌کند. در این مقاله، نحوه عملکرد این Workflow، تمام Node‌ها و روش شخصی‌سازی آن را به‌صورت کامل توضیح می‌دهیم.

قبل از شروع

اگر هنوز n8n را نصب نکرده‌اید، پیشنهاد می‌کنیم ابتدا مقاله «آموزش n8n» را مطالعه کنید. در آن مقاله، مراحل نصب با Node.js و Docker، راه‌اندازی اولیه و ساخت اولین Workflow به‌صورت کامل آموزش داده شده است. پس از نصب و راه‌اندازی، به این مقاله بازگردید و مراحل پیاده‌سازی این Workflow را دنبال کنید.

خودکارسازی اسکرپ سایت با n8n چه کاری انجام می‌دهد؟

این Workflow به‌عنوان یک خزنده مستقل عمل می‌کند که وب‌سایت‌ها را بدون نیاز به دخالت انسانی مرور می‌کند. فرآیند کلی به این صورت است: لیستی از نام شرکت‌ها و آدرس وب‌سایت‌ها از پایگاه داده خوانده می‌شود، سپس یک Agent هوش مصنوعی با دسترسی به دو ابزار مجزا (خزش متن و بازیابی لینک‌ها) وارد عمل می‌شود. این Agent ابتدا صفحه اصلی وب‌سایت را تحلیل می‌کند، سپس لینک‌های داخلی را دنبال کرده و در نهایت تمام لینک‌های شبکه‌های اجتماعی موجود در وب‌سایت را شناسایی می‌کند. نتیجه نهایی در قالب یک JSON استاندارد شامل نام پلتفرم و لینک‌های مرتبط برگردانده می‌شود.

کاربردهای خودکارسازی اسکرپ سایت با n8n

این Workflow برای سناریوهای متنوعی قابل استفاده است:

جمع‌آوری لینک‌های شبکه‌های اجتماعی شرکت‌ها جهت تحلیل رقبا و بازاریابی دیجیتال. بخش فروش و بازاریابی می‌تواند از این اطلاعات برای شناسایی کانال‌های ارتباطی مشتریان بالقوه بهره ببرد.

اتوماسیون فرآیند جمع‌آوری اطلاعات تماس برای کمپین‌های ایمیل مارکتینگ. به‌جای جستجوی دستی در هر وب‌سایت، خزنده به‌صورت خودکار داده‌ها را استخراج می‌کند.

تحلیل حضور دیجیتال رقبا در شبکه‌های اجتماعی مختلف. با مقایسه لینک‌های استخراج‌شده، می‌توان فهمید هر رقبا در کدام پلتفرم‌ها فعال‌تر است.

جمع‌آوری داده‌های شرکتی برای ساخت پروفایل‌های جامع در پلتفرم‌های CRM. اطلاعات استخراج‌شده مستقیماً به پایگاه داده CRM ارسال می‌شوند.

خودکارسازی فرآیند آدیت وب‌سایت برای شرکت‌های خدمات دیجیتال مارکتینگ. بررسی وجود یا عدم وجود لینک‌های شبکه‌های اجتماعی در وب‌سایت‌های مشتریان.

جمع‌آوری داده‌های عمومی شرکت‌ها برای تحقیقات بازار و تحلیل صنعت. محققان می‌توانند داده‌های استخراج‌شده را پردازش و تحلیل بیشتر کنند.

پیش‌نیازها

برای اجرای موفق این Workflow موارد زیر ضروری است. نصب n8n و اجرای موفق آن روی سرور یا سیستم محلی اولین قدم است. سپس به یک حساب کاربری OpenAI نیاز دارید تا API Key آن را دریافت کنید. مدل استفاده‌شده GPT-4o است و Credential مربوط به OpenAI باید در n8n تنظیم شود.

علاوه بر آن، یک حساب Supabase رایگان ایجاد کرده و دو جدول به نام‌های companies_input و companies_output بسازید. جدول ورودی شامل فیلدهای name (نام شرکت) و website (آدرس وب‌سایت) و جدول خروجی شامل فیلدهای مرتبط با نتایج استخراج‌شده باشد. Credential مربوط به Supabase API نیز باید در n8n پیکربندی گردد.

دانلود Template

فایل JSON این Workflow را از این قسمت دانلود کنید.

رمز فایل:danixai.com

آموزش Import کردن Workflow

  1. وارد داشبورد n8n شوید.
  2. روی Import from File کلیک کنید.
  3. فایل JSON را انتخاب کنید.
  4. Workflow ایجاد خواهد شد.
  5. Credentialهای موردنیاز را تنظیم کنید.

ساختار Workflow خودکارسازی اسکرپ سایت با n8n

ساختار کلی این Workflow به شکل زیر است:

Execute workflow → Get companies → Select company name and website → Crawl website (AI Agent) → Set social media array → Merge all data → Insert new row

Agent هوش مصنوعی خود از دو ابزار جداگانه استفاده می‌کند: ابزار Text برای خزش متن صفحات و ابزار URLs برای بازیابی و دنبال کردن لینک‌ها. همچنین اطلاعات نام شرکت و وب‌سایت به‌صورت موازی از مسیر Map company name and website به مرحله Merge ارسال می‌شود.

آموزش کامل تمام Nodeها

Execute workflow

نقطه شروع Workflow که با کلیک دستی اجرا می‌شود. ورودی ندارد و خروجی آن یک شیء خالی به مرحله بعدی منتقل می‌گردد. در محیط Production می‌توانید آن را با Cron Trigger یا Webhook Trigger جایگزین کنید.

Get companies

از نوع Supabase Node است که تمام ردیف‌های جدول companies_input را بازیابی می‌کند. ورودی خروجی Manual Trigger است و خروج آن لیستی از شرکت‌ها شامل نام و آدرس وب‌سایت می‌باشد. Credential Supabase باید از قبل تنظیم شده باشد. در صورت استفاده از پایگاه داده دیگر مانند PostgreSQL یا Airtable، این Node قابل جایگزینی است.

Select company name and website

این Set Node فیلدهای name و website را از خروجی Supabase استخراج می‌کند. ورودی خروج Get companies و خروج آن شیء ساده‌ای شامل نام شرکت و آدرس وب‌سایت است. دلیل استفاده: حذف فیلدهای اضافی و ارسال فقط داده‌های ضروری به Agent.

Crawl website

قلب اصلی این Workflow یک AI Agent از نوع @n8n/n8n-nodes-langchain.agent است. ورودی آن اطلاعات شرکت و وب‌سایت است. متن درخواست Agent به این صورت تعریف شده: Retrieve social media profile URLs from this website: {{ $json.website }}

پرامپت سیستمی Agent مشخص می‌کند که وی یک خزنده وب خودکار است و وظیفه استخراج لینک‌های شبکه‌های اجتماعی از صفحه وب را دارد. خروج Agent به مرحله Set social media array منتقل می‌شود. مدل GPT-4o با دما صفر (temperature: 0) و فرمت خروجی JSON تنظیم شده است.

Agent به دو ابزار Workflow دسترسی دارد: ابزار Text (text_retrieval_tool) برای دریافت متن کامل صفحات و ابزار URLs (url_retrieval_tool) برای استخراج لینک‌ها. همچنین یک Output Parser ساختاریافته نتایج را قالب‌بندی می‌کند.

OpenAI Chat Model

مدل زبانی مورد استفاده توسط Agent است. مقدار gpt-4o تنظیم شده با دمای صفر و فرمت خروجی json_object. Credential مربوط به OpenAI API باید از نوع OpenAI API Key باشد.

JSON Parser

یک Output Parser ساختاریافته که خروج Agent را به فرمت JSON استاندارد تبدیل می‌کند. Schema تعریف‌شده شامل آرایه‌ای از آبجکت‌هاست که هر کدام دارای platform (نام پلتفرم) و urls (آرایه لینک‌ها) هستند. دلیل استفاده: اطمینان از یکپارچگی خروج و سازگاری با مراحل بعدی.

ابزار Text (text_retrieval_tool)

یک Sub-Workflow مستقل شامل پنج Node است. ابتدا دامنه دریافت و پروتکل HTTP اضافه می‌شود، سپس درخواست HTTP برای دریافت HTML صفحه ارسال گردد. HTML دریافتی به Markdown تبدیل شده و متن خام استخراج می‌شود. در نهایت پاسخ به Agent برگردانده می‌گردد. این ابزار تمام متن قابل خواندن صفحه را بدون لینک‌ها و تصاویر برمی‌گرداند.

ابزار URLs (url_retrieval_tool)

Sub-Workflow دیگری با نُه Node داخلی. پس از دریافت HTML صفحه، تمام تگ‌های <a> استخراج شده و href آن‌ها جدا می‌شوند. لینک‌های خالی حذف شده، تکراری‌ها فیلتر می‌گردند و Node دوم مسیرهای نسبی را به URL کامل تبدیل می‌کند. لینک‌های نامعتبر نیز حذف شده و در نهایت تمام URLهای صحیح به Agent بازگردانده می‌شوند.

Map company name and website

Node Set دیگری که نام شرکت و آدرس وب‌سایت را از خروج Agent استخراج کرده و به مرحله Merge ارسال می‌کند. این مسیر موازی با مسیر اصلی Agent اجرا می‌شود تا اطلاعات شرکت در مرحله ترکیب حفظ گردد.

Set social media array

خروج Agent را دریافت کرده و فیلد social_media را استخراج می‌نماید. ورودی خروج Crawl website و خروج آن آرایه‌ای از آبجکت‌های شامل نام پلتفرم و لینک‌هاست.

Merge all data

Node Merge که دو مسیر ورودی را ترکیب می‌کند. مسیر اول اطلاعات شرکت (نام و وب‌سایت) و مسیر دوم نتایج استخراج‌شده (لینک‌های شبکه اجتماعی) را بر اساس موقعیت با هم ادغام می‌نماید.

Insert new row

مرحله نهایی که داده ترکیب‌شده را در جدول companies_output پایگاه داده Supabase ذخیره می‌کند. Credential مورد استفاده دقیقاً همان Credential مربوط به مرحله Get companies است.

نحوه شخصی‌سازی خودکارسازی اسکرپ سایت با n8n

مدل هوش مصنوعی

مدل GPT-4o قابل جایگزینی با سایر مدل‌های OpenAI مانند GPT-4 Turbo یا GPT-3.5 Turbo است. در صورت نیاز به صرفه‌جویی در هزینه، GPT-3.5 Turbo گزینه مناسبی خواهد بود.

پایگاه داده

Supabase می‌تواند با PostgreSQL مستقیم، MongoDB، Airtable یا هر پایگاه داده دیگری که n8n پشتیبانی می‌کند جایگزین شود. نام جدول‌ها و فیلدها باید متناسب با پایگاه داده جدید به‌روزرسانی شود.

نوع داده خروجی

Schema در JSON Parser قابل ویرایش است. می‌توانید فیلدهای بیشتری مانند شماره تلفن، ایمیل یا آدرس فیزیکی اضافه کنید. پرامپت سیستمی Agent نیز باید متناسب با داده جدید تغییر کند.

Trigger و زمان‌بندی

Execute Workflow Trigger را می‌توانید با Cron Trigger جایگزین کنید تا خزش در بازه‌های زمانی مشخص (مثلاً روزانه یا هفتگی) اجرا شود. Webhook Trigger نیز امکان فراخوانی Workflow از طریق API خارجی را فراهم می‌کند.

پروکسی و دقت خزش

همان‌طور که در یادداشت‌های Sticky Note اشاره شده، اضافه کردن پروکسی به Nodeهای HTTP Request می‌تواند دقت خزش را افزایش دهد. برخی وب‌سایت‌ها درخواست‌های بدون پروکسی را مسدود می‌کنند.

مزایای استفاده از این Workflow

اتوماسیون سازی اسکرپ سایت با هوش مصنوعی مزایای متعددی دارد. نخست اینکه فرآیند کاملاً بدون دخالت انسانی اجرا می‌شود و نیازی به نظارت مستمر نیست. دوم اینکه Agent هوش مصنوعی قادر است صفحات مختلف یک وب‌سایت را دنبال کند و از محدودیت صفحه اصلی فراتر رود. سوم آنکه خروج به‌صورت JSON استاندارد تولید می‌شود و پردازش بعدی آن آسان است.

چهارمین مزیت، امکان پردازش دسته‌ای شرکت‌هاست. با داشتن لیستی از وب‌سایت‌ها در پایگاه داده، Workflow تمام آن‌ها را به‌صورت خودکار اسکرپ می‌کند. پنجم اینکه Workflow قابل گسترش است و می‌توان انواع داده‌های دیگر مانند اطلاعات تماس یا محصولات را نیز استخراج کرد. ششمین مزیت استفاده از Output Parser است که خروج را در قالب ساختاریافته برمی‌گرداند و نیاز به پردازش دستی را حذف می‌کند.

نکات مهم خودکارسازی اسکرپ سایت با n8n

Credential OpenAI باید از نوع OpenAI API Key باشد و حساب کاربری شما دارای اعتبار کافی برای استفاده از مدل GPT-4o باشد. هزینه درخواست‌ها بر اساس تعداد توکن‌های مصرفی محاسبه می‌شود.

نام فیلدهای جدول Supabase باید دقیقاً با مقادیر تعریف‌شده در Nodeها مطابقت داشته باشد. در صورت تغییر نام فیلدها، تمام Nodeهای Set مرتبط باید به‌روزرسانی شوند.

داده‌های Pin شده در Node Get companies فقط برای تست هستند و در محیط Production باید حذف شوند تا Workflow واقعی اجرا شود.

برخی وب‌سایت‌ها از محافظت در برابر خزنده‌ها (anti-bot) استفاده می‌کنند. در این صورت اضافه کردن پروکسی یا تأخیر بین درخواست‌ها ضروری است.

مقدار temperature: 0 در مدل OpenAI تضمین می‌کند خروج Agent هر بار یکسان و قابل پیش‌بینی باشد. تغییر این مقدار ممکنه نتایج ناپایداری ایجاد کند.

نکته مهم بعدی مربوط به نسخه Node است. پس از import کردن Workflow، ممکن است نسخه‌های Node به‌روزرسانی نشده باشند. وضعیت هر Node را بررسی کنید و در صورت نیاز نسخه آن را ارتقا دهید.

حجم پاسخ HTTP از وب‌سایت‌های بزرگ ممکن است محدودیت حافظه n8n را فراخوانی کند. برای وب‌سایت‌های حجیم، فیلتر کردن تگ‌های اضافی یا محدود کردن تعداد صفحات خزش‌شده پیشنهاد می‌شود.

در نهایت، این Workflow بخشی از یک فرآیند بزرگتر است. در محیط Production، مکانیزم‌های مدیریت خطا مانند retryOnFail فعال هستند اما بررسی منظم لاگ‌ها ضروری می‌باشد.

خطاهای رایج در خودکارسازی اسکرپ سایت با n8n

مشکل احراز هویت OpenAI

علت: Credential OpenAI به‌درستی تنظیم نشده یا API Key منقضی شده. راه‌حل: Credential را در بخش Credentials n8n بررسی کنید و مطمئن شوید API Key فعال و دارای اعتبار است.

خطای اتصال به Supabase

علت: URL یا API Key Supabase نادرست است یا جدول‌های مورد نیاز ایجاد نشده‌اند. راه‌حل: آدرس پروژه و API Key را از داشبورد Supabase کپی کرده و Credential را به‌روزرسانی نمایید. وجود جداول companies_input و companies_output را تأیید کنید.

خروجی خالی از Agent

علت: وب‌سایت هدف لینک شبکه اجتماعی ندارد یا Agent نتوانسته صفحات را به‌درستی تحلیل کند. راه‌حل: پرامپت سیستمی Agent را بررسی کنید و مطمئن شوید ابزارها به‌درستی متصل هستند. وب‌سایت نمونه را به‌صورت دستی آزمایش نمایید.

خطای فرمت JSON در خروج

علت: خروج Agent با Schema تعریف‌شده در JSON Parser مطابقت ندارد. راه‌حل: Schema پارسر را با دقت بررسی کنید و مطمئن شوید فیلدهای platform و urls به‌صورت دقیق تعریف شده‌اند. دمای مدل را روی صفر نگه دارید.

درخواست‌های مسدودشده توسط وب‌سایت

علت: وب‌سایت هدف از محافظت anti-bot استفاده می‌کند و درخواست‌ها را بلاک می‌کند. راه‌حل: پروکسی را به Nodeهای HTTP Request اضافه کنید یا User-Agent معتبری تنظیم نمایید.

جمع‌بندی خودکارسازی اسکرپ سایت با n8n

خودکارسازی خزش وب‌سایت با هوش مصنوعی در n8n رویکردی نوین و کارآمد برای جمع‌آوری داده‌های عمومی از اینترنت است. این Workflow با ترکیب قابلیت‌های Agent هوش مصنوعی OpenAI و پایگاه داده Supabase، فرآیندی کاملاً خودکار ایجاد می‌کند. از دریافت لیست شرکت‌ها تا استخراج لینک‌های شبکه‌های اجتماعی و ذخیره نتایج، تمام مراحل بدون دخالت انسانی اجرا می‌شوند.

با درک عملکرد هر Node و شخصی‌سازی متناسب با نیازهای خود، می‌توانید این الگو را برای انواع داده‌های دیگر مانند اطلاعات تماس، آدرس ایمیل یا لیست محصولات نیز گسترش دهید. خودکارسازی خزش وب‌سایت با هوش مصنوعی در n8n پایه‌ای قدرتمند برای پروژه‌های جمع‌آوری داده در مقیاس بزرگ فراهم می‌کند.

سوالات متداول

آیا این Workflow برای تمام وب‌سایت‌ها کار می‌کند؟

بله، اما برخی وب‌سایت‌ها از محافظت anti-bot استفاده می‌کنند. در این صورت اضافه کردن پروکسی ضروری است. همچنین وب‌سایت‌هایی که محتوا را به‌صورت داینامیک بارگذاری می‌کنند ممکن است نیاز به ابزار متفاوتی مانند Puppeteer داشته باشند.

آیا استفاده از GPT-4o هزینه زیادی دارد؟

هزینه بستگی به تعداد وب‌سایت‌ها و حجم محتوای آن‌ها دارد. برای کاهش هزینه می‌توانید از GPT-3.5 Turbo استفاده کنید یا محدودیت تعداد صفحات خزش‌شده را تعیین نمایید.

آیا می‌توانم این Workflow را برای استخراج داده‌های دیگری غیر از شبکه‌های اجتماعی استفاده کنم؟

بله. با تغییر پرامپت سیستمی Agent و Schema در JSON Parser، می‌توانید انواع داده‌های دیگر مانند شماره تلفن، ایمیل یا لیست محصولات را استخراج کنید.

نحوه افزایش سرعت خزش چگونه است؟

برای افزایش سرعت، تعداد همزمانی درخواست‌ها را افزایش دهید یا از پروکسی‌های متعدد استفاده کنید. همچنین می‌توانید Workflow را به‌صورت موازی برای چند شرکت اجرا نمایید.

آیا داده‌های استخراج‌شده قابل بازیابی مجدد هستند؟

بله، تمام نتایج در جدول companies_output ذخیره می‌شوند. می‌توانید در صورت نیاز Workflow را مجدداً اجرا کرده یا داده‌های قبلی را از پایگاه داده بازیابی نمایید.

 

GIT

Categories: , ,

توسعه توسط تیم میهن وردپرس