مقدمه
خودکارسازی اسکرپ سایت با n8n :
N8Nابزاری است که به کمک آن می توانید در مدتزمان کوتاهی، فرایندهای خود را با هوش مصنوعی خودکار کنید و از مزایای اتوماسیون هوشمند بهره مند شوید.
N8N برای چه کسب و کارهایی مناسب است:
اگر سازمان شما کوچک می باشد و هم اکنون بسیاری از کار های خود را با نرم افزار هایی همچون اکسل انجام می دهید، N8N برای کسب و کار شما ایده آل است و در صورتی که کسب و کاری متوسط یا بزرگ دارید می توانید بخش های بسیاری از فرایند های غیر کلیدی خود را با این ابزار هوشمند کنید.
اگر به پیادهسازی اختصاصی، اتصال n8n به نرمافزارهای سازمانی یا سفارشیسازی Workflowها متناسب با کسبوکارتان نیاز دارید، Danix با بررسی نیازهای کسبوکار شما، میتواند این فرایند را از طراحی تا استقرار برای شما انجام دهیم.
همچنین اگر ترجیح میدهید شخصاً نصب و راهاندازی را انجام دهید، میتوانید از اطلاعات موجود در مقالات، دسته N8N استفاده کنید .همچنین می توانید template موجود در این workflow را به صورت رایگان از این قسمت دانلود کنید.
خودکارسازی اسکرپ سایت با n8n
خودکارسازی خزش وبسایت با هوش مصنوعی در n8n یکی از کاربردیترین سناریوهای اتوماسیون در حوزه جمعآوری دادههای وب است. در بسیاری از کسبوکارها، نیاز به استخراج اطلاعات تماس، لینکهای شبکههای اجتماعی یا سایر دادههای عمومی از وبسایتهای مختلف وجود دارد. انجام دستی این فرآیند برای تعداد زیادی وبسایت، زمانبر و هزینهبر است. با استفاده از n8n و قابلیتهای هوش مصنوعی OpenAI، میتوان یک خزنده خودکار ایجاد کرد که وبسایتها را مرور کند، محتوا را تحلیل کند و دادههای مورد نیاز را بهصورت ساختاریافته استخراج نماید.
این Workflow با دریافت لیست شرکتها از یک پایگاه داده، وبسایت هر شرکت را خزش میکند و لینکهای شبکههای اجتماعی آن را شناسایی و Agent دادهها را بازیابی کرده و در قالب JSON یکپارچه برمیگرداند سپس Workflow نتایج استخراجشده را در جدول خروجی پایگاه داده ذخیره میکند. در این مقاله، نحوه عملکرد این Workflow، تمام Nodeها و روش شخصیسازی آن را بهصورت کامل توضیح میدهیم.
قبل از شروع
اگر هنوز n8n را نصب نکردهاید، پیشنهاد میکنیم ابتدا مقاله «آموزش n8n» را مطالعه کنید. در آن مقاله، مراحل نصب با Node.js و Docker، راهاندازی اولیه و ساخت اولین Workflow بهصورت کامل آموزش داده شده است. پس از نصب و راهاندازی، به این مقاله بازگردید و مراحل پیادهسازی این Workflow را دنبال کنید.
خودکارسازی اسکرپ سایت با n8n چه کاری انجام میدهد؟
این Workflow بهعنوان یک خزنده مستقل عمل میکند که وبسایتها را بدون نیاز به دخالت انسانی مرور میکند. فرآیند کلی به این صورت است: لیستی از نام شرکتها و آدرس وبسایتها از پایگاه داده خوانده میشود، سپس یک Agent هوش مصنوعی با دسترسی به دو ابزار مجزا (خزش متن و بازیابی لینکها) وارد عمل میشود. این Agent ابتدا صفحه اصلی وبسایت را تحلیل میکند، سپس لینکهای داخلی را دنبال کرده و در نهایت تمام لینکهای شبکههای اجتماعی موجود در وبسایت را شناسایی میکند. نتیجه نهایی در قالب یک JSON استاندارد شامل نام پلتفرم و لینکهای مرتبط برگردانده میشود.
کاربردهای خودکارسازی اسکرپ سایت با n8n
این Workflow برای سناریوهای متنوعی قابل استفاده است:
جمعآوری لینکهای شبکههای اجتماعی شرکتها جهت تحلیل رقبا و بازاریابی دیجیتال. بخش فروش و بازاریابی میتواند از این اطلاعات برای شناسایی کانالهای ارتباطی مشتریان بالقوه بهره ببرد.
اتوماسیون فرآیند جمعآوری اطلاعات تماس برای کمپینهای ایمیل مارکتینگ. بهجای جستجوی دستی در هر وبسایت، خزنده بهصورت خودکار دادهها را استخراج میکند.
تحلیل حضور دیجیتال رقبا در شبکههای اجتماعی مختلف. با مقایسه لینکهای استخراجشده، میتوان فهمید هر رقبا در کدام پلتفرمها فعالتر است.
جمعآوری دادههای شرکتی برای ساخت پروفایلهای جامع در پلتفرمهای CRM. اطلاعات استخراجشده مستقیماً به پایگاه داده CRM ارسال میشوند.
خودکارسازی فرآیند آدیت وبسایت برای شرکتهای خدمات دیجیتال مارکتینگ. بررسی وجود یا عدم وجود لینکهای شبکههای اجتماعی در وبسایتهای مشتریان.
جمعآوری دادههای عمومی شرکتها برای تحقیقات بازار و تحلیل صنعت. محققان میتوانند دادههای استخراجشده را پردازش و تحلیل بیشتر کنند.
پیشنیازها
برای اجرای موفق این Workflow موارد زیر ضروری است. نصب n8n و اجرای موفق آن روی سرور یا سیستم محلی اولین قدم است. سپس به یک حساب کاربری OpenAI نیاز دارید تا API Key آن را دریافت کنید. مدل استفادهشده GPT-4o است و Credential مربوط به OpenAI باید در n8n تنظیم شود.
علاوه بر آن، یک حساب Supabase رایگان ایجاد کرده و دو جدول به نامهای companies_input و companies_output بسازید. جدول ورودی شامل فیلدهای name (نام شرکت) و website (آدرس وبسایت) و جدول خروجی شامل فیلدهای مرتبط با نتایج استخراجشده باشد. Credential مربوط به Supabase API نیز باید در n8n پیکربندی گردد.
دانلود Template
فایل JSON این Workflow را از این قسمت دانلود کنید.
رمز فایل:danixai.com
آموزش Import کردن Workflow
- وارد داشبورد n8n شوید.
- روی Import from File کلیک کنید.
- فایل JSON را انتخاب کنید.
- Workflow ایجاد خواهد شد.
- Credentialهای موردنیاز را تنظیم کنید.
ساختار Workflow خودکارسازی اسکرپ سایت با n8n
ساختار کلی این Workflow به شکل زیر است:
Execute workflow → Get companies → Select company name and website → Crawl website (AI Agent) → Set social media array → Merge all data → Insert new row
Agent هوش مصنوعی خود از دو ابزار جداگانه استفاده میکند: ابزار Text برای خزش متن صفحات و ابزار URLs برای بازیابی و دنبال کردن لینکها. همچنین اطلاعات نام شرکت و وبسایت بهصورت موازی از مسیر Map company name and website به مرحله Merge ارسال میشود.
آموزش کامل تمام Nodeها
Execute workflow
نقطه شروع Workflow که با کلیک دستی اجرا میشود. ورودی ندارد و خروجی آن یک شیء خالی به مرحله بعدی منتقل میگردد. در محیط Production میتوانید آن را با Cron Trigger یا Webhook Trigger جایگزین کنید.
Get companies
از نوع Supabase Node است که تمام ردیفهای جدول companies_input را بازیابی میکند. ورودی خروجی Manual Trigger است و خروج آن لیستی از شرکتها شامل نام و آدرس وبسایت میباشد. Credential Supabase باید از قبل تنظیم شده باشد. در صورت استفاده از پایگاه داده دیگر مانند PostgreSQL یا Airtable، این Node قابل جایگزینی است.
Select company name and website
این Set Node فیلدهای name و website را از خروجی Supabase استخراج میکند. ورودی خروج Get companies و خروج آن شیء سادهای شامل نام شرکت و آدرس وبسایت است. دلیل استفاده: حذف فیلدهای اضافی و ارسال فقط دادههای ضروری به Agent.
Crawl website
قلب اصلی این Workflow یک AI Agent از نوع @n8n/n8n-nodes-langchain.agent است. ورودی آن اطلاعات شرکت و وبسایت است. متن درخواست Agent به این صورت تعریف شده: Retrieve social media profile URLs from this website: {{ $json.website }}
پرامپت سیستمی Agent مشخص میکند که وی یک خزنده وب خودکار است و وظیفه استخراج لینکهای شبکههای اجتماعی از صفحه وب را دارد. خروج Agent به مرحله Set social media array منتقل میشود. مدل GPT-4o با دما صفر (temperature: 0) و فرمت خروجی JSON تنظیم شده است.
Agent به دو ابزار Workflow دسترسی دارد: ابزار Text (text_retrieval_tool) برای دریافت متن کامل صفحات و ابزار URLs (url_retrieval_tool) برای استخراج لینکها. همچنین یک Output Parser ساختاریافته نتایج را قالببندی میکند.
OpenAI Chat Model
مدل زبانی مورد استفاده توسط Agent است. مقدار gpt-4o تنظیم شده با دمای صفر و فرمت خروجی json_object. Credential مربوط به OpenAI API باید از نوع OpenAI API Key باشد.
JSON Parser
یک Output Parser ساختاریافته که خروج Agent را به فرمت JSON استاندارد تبدیل میکند. Schema تعریفشده شامل آرایهای از آبجکتهاست که هر کدام دارای platform (نام پلتفرم) و urls (آرایه لینکها) هستند. دلیل استفاده: اطمینان از یکپارچگی خروج و سازگاری با مراحل بعدی.
ابزار Text (text_retrieval_tool)
یک Sub-Workflow مستقل شامل پنج Node است. ابتدا دامنه دریافت و پروتکل HTTP اضافه میشود، سپس درخواست HTTP برای دریافت HTML صفحه ارسال گردد. HTML دریافتی به Markdown تبدیل شده و متن خام استخراج میشود. در نهایت پاسخ به Agent برگردانده میگردد. این ابزار تمام متن قابل خواندن صفحه را بدون لینکها و تصاویر برمیگرداند.
ابزار URLs (url_retrieval_tool)
Sub-Workflow دیگری با نُه Node داخلی. پس از دریافت HTML صفحه، تمام تگهای <a> استخراج شده و href آنها جدا میشوند. لینکهای خالی حذف شده، تکراریها فیلتر میگردند و Node دوم مسیرهای نسبی را به URL کامل تبدیل میکند. لینکهای نامعتبر نیز حذف شده و در نهایت تمام URLهای صحیح به Agent بازگردانده میشوند.
Map company name and website
Node Set دیگری که نام شرکت و آدرس وبسایت را از خروج Agent استخراج کرده و به مرحله Merge ارسال میکند. این مسیر موازی با مسیر اصلی Agent اجرا میشود تا اطلاعات شرکت در مرحله ترکیب حفظ گردد.
Set social media array
خروج Agent را دریافت کرده و فیلد social_media را استخراج مینماید. ورودی خروج Crawl website و خروج آن آرایهای از آبجکتهای شامل نام پلتفرم و لینکهاست.
Merge all data
Node Merge که دو مسیر ورودی را ترکیب میکند. مسیر اول اطلاعات شرکت (نام و وبسایت) و مسیر دوم نتایج استخراجشده (لینکهای شبکه اجتماعی) را بر اساس موقعیت با هم ادغام مینماید.
Insert new row
مرحله نهایی که داده ترکیبشده را در جدول companies_output پایگاه داده Supabase ذخیره میکند. Credential مورد استفاده دقیقاً همان Credential مربوط به مرحله Get companies است.
نحوه شخصیسازی خودکارسازی اسکرپ سایت با n8n
مدل هوش مصنوعی
مدل GPT-4o قابل جایگزینی با سایر مدلهای OpenAI مانند GPT-4 Turbo یا GPT-3.5 Turbo است. در صورت نیاز به صرفهجویی در هزینه، GPT-3.5 Turbo گزینه مناسبی خواهد بود.
پایگاه داده
Supabase میتواند با PostgreSQL مستقیم، MongoDB، Airtable یا هر پایگاه داده دیگری که n8n پشتیبانی میکند جایگزین شود. نام جدولها و فیلدها باید متناسب با پایگاه داده جدید بهروزرسانی شود.
نوع داده خروجی
Schema در JSON Parser قابل ویرایش است. میتوانید فیلدهای بیشتری مانند شماره تلفن، ایمیل یا آدرس فیزیکی اضافه کنید. پرامپت سیستمی Agent نیز باید متناسب با داده جدید تغییر کند.
Trigger و زمانبندی
Execute Workflow Trigger را میتوانید با Cron Trigger جایگزین کنید تا خزش در بازههای زمانی مشخص (مثلاً روزانه یا هفتگی) اجرا شود. Webhook Trigger نیز امکان فراخوانی Workflow از طریق API خارجی را فراهم میکند.
پروکسی و دقت خزش
همانطور که در یادداشتهای Sticky Note اشاره شده، اضافه کردن پروکسی به Nodeهای HTTP Request میتواند دقت خزش را افزایش دهد. برخی وبسایتها درخواستهای بدون پروکسی را مسدود میکنند.
مزایای استفاده از این Workflow
اتوماسیون سازی اسکرپ سایت با هوش مصنوعی مزایای متعددی دارد. نخست اینکه فرآیند کاملاً بدون دخالت انسانی اجرا میشود و نیازی به نظارت مستمر نیست. دوم اینکه Agent هوش مصنوعی قادر است صفحات مختلف یک وبسایت را دنبال کند و از محدودیت صفحه اصلی فراتر رود. سوم آنکه خروج بهصورت JSON استاندارد تولید میشود و پردازش بعدی آن آسان است.
چهارمین مزیت، امکان پردازش دستهای شرکتهاست. با داشتن لیستی از وبسایتها در پایگاه داده، Workflow تمام آنها را بهصورت خودکار اسکرپ میکند. پنجم اینکه Workflow قابل گسترش است و میتوان انواع دادههای دیگر مانند اطلاعات تماس یا محصولات را نیز استخراج کرد. ششمین مزیت استفاده از Output Parser است که خروج را در قالب ساختاریافته برمیگرداند و نیاز به پردازش دستی را حذف میکند.
نکات مهم خودکارسازی اسکرپ سایت با n8n
Credential OpenAI باید از نوع OpenAI API Key باشد و حساب کاربری شما دارای اعتبار کافی برای استفاده از مدل GPT-4o باشد. هزینه درخواستها بر اساس تعداد توکنهای مصرفی محاسبه میشود.
نام فیلدهای جدول Supabase باید دقیقاً با مقادیر تعریفشده در Nodeها مطابقت داشته باشد. در صورت تغییر نام فیلدها، تمام Nodeهای Set مرتبط باید بهروزرسانی شوند.
دادههای Pin شده در Node Get companies فقط برای تست هستند و در محیط Production باید حذف شوند تا Workflow واقعی اجرا شود.
برخی وبسایتها از محافظت در برابر خزندهها (anti-bot) استفاده میکنند. در این صورت اضافه کردن پروکسی یا تأخیر بین درخواستها ضروری است.
مقدار temperature: 0 در مدل OpenAI تضمین میکند خروج Agent هر بار یکسان و قابل پیشبینی باشد. تغییر این مقدار ممکنه نتایج ناپایداری ایجاد کند.
نکته مهم بعدی مربوط به نسخه Node است. پس از import کردن Workflow، ممکن است نسخههای Node بهروزرسانی نشده باشند. وضعیت هر Node را بررسی کنید و در صورت نیاز نسخه آن را ارتقا دهید.
حجم پاسخ HTTP از وبسایتهای بزرگ ممکن است محدودیت حافظه n8n را فراخوانی کند. برای وبسایتهای حجیم، فیلتر کردن تگهای اضافی یا محدود کردن تعداد صفحات خزششده پیشنهاد میشود.
در نهایت، این Workflow بخشی از یک فرآیند بزرگتر است. در محیط Production، مکانیزمهای مدیریت خطا مانند retryOnFail فعال هستند اما بررسی منظم لاگها ضروری میباشد.
خطاهای رایج در خودکارسازی اسکرپ سایت با n8n
مشکل احراز هویت OpenAI
علت: Credential OpenAI بهدرستی تنظیم نشده یا API Key منقضی شده. راهحل: Credential را در بخش Credentials n8n بررسی کنید و مطمئن شوید API Key فعال و دارای اعتبار است.
خطای اتصال به Supabase
علت: URL یا API Key Supabase نادرست است یا جدولهای مورد نیاز ایجاد نشدهاند. راهحل: آدرس پروژه و API Key را از داشبورد Supabase کپی کرده و Credential را بهروزرسانی نمایید. وجود جداول companies_input و companies_output را تأیید کنید.
خروجی خالی از Agent
علت: وبسایت هدف لینک شبکه اجتماعی ندارد یا Agent نتوانسته صفحات را بهدرستی تحلیل کند. راهحل: پرامپت سیستمی Agent را بررسی کنید و مطمئن شوید ابزارها بهدرستی متصل هستند. وبسایت نمونه را بهصورت دستی آزمایش نمایید.
خطای فرمت JSON در خروج
علت: خروج Agent با Schema تعریفشده در JSON Parser مطابقت ندارد. راهحل: Schema پارسر را با دقت بررسی کنید و مطمئن شوید فیلدهای platform و urls بهصورت دقیق تعریف شدهاند. دمای مدل را روی صفر نگه دارید.
درخواستهای مسدودشده توسط وبسایت
علت: وبسایت هدف از محافظت anti-bot استفاده میکند و درخواستها را بلاک میکند. راهحل: پروکسی را به Nodeهای HTTP Request اضافه کنید یا User-Agent معتبری تنظیم نمایید.
جمعبندی خودکارسازی اسکرپ سایت با n8n
خودکارسازی خزش وبسایت با هوش مصنوعی در n8n رویکردی نوین و کارآمد برای جمعآوری دادههای عمومی از اینترنت است. این Workflow با ترکیب قابلیتهای Agent هوش مصنوعی OpenAI و پایگاه داده Supabase، فرآیندی کاملاً خودکار ایجاد میکند. از دریافت لیست شرکتها تا استخراج لینکهای شبکههای اجتماعی و ذخیره نتایج، تمام مراحل بدون دخالت انسانی اجرا میشوند.
با درک عملکرد هر Node و شخصیسازی متناسب با نیازهای خود، میتوانید این الگو را برای انواع دادههای دیگر مانند اطلاعات تماس، آدرس ایمیل یا لیست محصولات نیز گسترش دهید. خودکارسازی خزش وبسایت با هوش مصنوعی در n8n پایهای قدرتمند برای پروژههای جمعآوری داده در مقیاس بزرگ فراهم میکند.
سوالات متداول
آیا این Workflow برای تمام وبسایتها کار میکند؟
بله، اما برخی وبسایتها از محافظت anti-bot استفاده میکنند. در این صورت اضافه کردن پروکسی ضروری است. همچنین وبسایتهایی که محتوا را بهصورت داینامیک بارگذاری میکنند ممکن است نیاز به ابزار متفاوتی مانند Puppeteer داشته باشند.
آیا استفاده از GPT-4o هزینه زیادی دارد؟
هزینه بستگی به تعداد وبسایتها و حجم محتوای آنها دارد. برای کاهش هزینه میتوانید از GPT-3.5 Turbo استفاده کنید یا محدودیت تعداد صفحات خزششده را تعیین نمایید.
آیا میتوانم این Workflow را برای استخراج دادههای دیگری غیر از شبکههای اجتماعی استفاده کنم؟
بله. با تغییر پرامپت سیستمی Agent و Schema در JSON Parser، میتوانید انواع دادههای دیگر مانند شماره تلفن، ایمیل یا لیست محصولات را استخراج کنید.
نحوه افزایش سرعت خزش چگونه است؟
برای افزایش سرعت، تعداد همزمانی درخواستها را افزایش دهید یا از پروکسیهای متعدد استفاده کنید. همچنین میتوانید Workflow را بهصورت موازی برای چند شرکت اجرا نمایید.
آیا دادههای استخراجشده قابل بازیابی مجدد هستند؟
بله، تمام نتایج در جدول companies_output ذخیره میشوند. میتوانید در صورت نیاز Workflow را مجدداً اجرا کرده یا دادههای قبلی را از پایگاه داده بازیابی نمایید.



