GPT
W

web-scraper

רץ בדפדפן

Agents-MCP-Hackathonרישיון לא דווח2025-06-04

  • gradio
  • mcp-server

מחלץ תוכן מעמודי אינטרנט, ממיר אותו למרקדאון ומייצר מפות קישורים. הוא מתאים למי שצריך לשאוב טקסט נקי מאתרים או לחבר כלי סריקה למודלי שפה.

  • הורדות בחודש
  • 112לייקים

מה זה

מזינים כתובת אינטרנט רגילה ומקבלים את הטקסט של העמוד נקי מסקריפטים ומעיצובים, כשהוא מומר ישירות לפורמט מרקדאון ושומר על היררכיית הכותרות. בנוסף, הוא מסוגל לאסוף את כל הקישורים בעמוד, למיין אותם לקישורים פנימיים וחיצוניים, ואפילו לחלץ תוכן מכל הקישורים הפנימיים בחבילת קובצי זיפ להורדה.

מאחורי הקלעים אין פה מודל בינה מלאכותית שלומד או מנחש. התשתית מבוססת על ספריות פייתון סטנדרטיות, requests להורדת הדפים, BeautifulSoup ו־lxml לניתוח ה־HTML, ו־markdownify לתרגום התוכן למרקדאון. הכלי גם נבנה מראש לפעול כשרת MCP עם כלים מובנים כדי שסוכני AI יוכלו לתשאל אותו ישירות.

מתאים ל

  • המרת מאמרים למרקדאון

    מזינים קישור למאמר ומקבלים קובץ מרקדאון נקי מסקריפטים ומפרסומות לשמירה מקומית.

  • מיפוי קישורים באתר

    מוציאים רשימה מסודרת של קישורים פנימיים וחיצוניים מתוך עמוד נחיתה או דף בית.

  • חיבור כלי סריקה ל־AI

    מגדירים את השרת ככלי MCP כדי לתת לתוכנות כמו קלוד גישה ישירה לחילוץ תוכן מאתרים.

איפה זה נופל

הכלי מבוסס על ספריית requests פשוטה, ולכן הוא לא מריץ JavaScript. אתרים שבנויים על ריאקט, עמודים שדורשים גלילה ארוכה כדי לטעון נתונים או אתרים שחוסמים בוטים באמצעות קפצ'ה פשוט יחזירו שגיאה או עמוד ריק. לא הייתי בונה עליו לחילוץ מידע מאפליקציות ווב מודרניות ומורכבות.

שאלות
נפוצות

האם הכלי עולה כסף?

השימוש בממשק וספריות הקוד פתוחים לגמרי ללא תשלום. אין צורך בהרשמה או בהזנת כרטיס אשראי כדי להשתמש בו ברשת או להוריד אותו למחשב.

האם אפשר להריץ אותו מקומית?

כן, הקוד כולל קובצי הפעלה מקומיים גם לממשק הרגיל וגם לשרת ה־MCP דרך פקודות פייתון פשוטות. כל התלויות הנדרשות מפורטות בקובץ הדרישות של הפרויקט.

האם הוא מתאים לאתרים בעברית?

הוא מטפל בטקסט כפי שהוא מופיע בקוד המקור של העמוד. אם האתר משתמש בקידוד תקין, העברית תחולץ כרגיל לקובץ המרקדאון.

האם יש פה מודל שפה שמסכם את האתר?

לא. מדובר במגרד אתרים טכני שמנקה תגיות HTML וממיר אותן לתחביר מרקדאון. אין פה שום בינה מלאכותית שמנתחת או מתמצתת את הכתוב.

איך משתמשים

בוחרים לשונית בממשק, מדביקים קישור ולוחצים על כפתור ההפעלה כדי לראות את התוצאה ולהוריד קובץ מרקדאון או זיפ. המערכת רצה על מעבד בסיסי בלי מאיץ גרפי, אבל לגירוד עמודי HTML פשוטים זה מספיק בהחלט והתוצאה חוזרת תוך שניות, אלא אם מפעילים חילוץ גורף של עשרות קישורים פנימיים בבת אחת.

הרישיון

היוצרים לא הגדירו רישיון שימוש בקוד. המשמעות היא שזכויות היוצרים שמורות להם ולא ברור אם מותר לשלב חלקים ממנו בפרויקטים מסחריים. לגבי המידע שאתם גורפים, החוקיות תלויה לחלוטין בתנאי השימוש של האתרים שמהם אתם מושכים את התוכן.

הרישיון המלא ב־Hugging Face ↗