GPT
C

ColPali-demo

רץ בדפדפן

manuרישיון לא דווח2024-06-24

  • gradio

הדגמה לחיפוש ויזואלי בתוך מסמכי PDF באמצעות מודל מולטימודלי. אתם מעלים קבצים, שואלים שאלה ומקבלים את הדפים הרלוונטיים ביותר.

  • הורדות בחודש
  • 128לייקים

מה זה

אתם מעלים קובץ PDF אחד או יותר, והקוד ממיר כל עמוד לתמונה באמצעות ספריית pdf2image. במקום לחלץ טקסט גולמי רגיל בשיטות OCR ישנות, הוא שולח את התמונות למודל vidore/colqwen2-v1.0 שיוצר ייצוג וקטורי ישירות מתוך המראה של הדף.

לאחר שלב האינדוקס, כותבים שאילתת טקסט ובוחרים בעזרת סליידר כמה תוצאות רוצים לקבל. הפלט מציג גלריית תמונות של העמודים שהכי מתאימים לשאלה שלכם, יחד עם תיבת טקסט שמפרטת את הנתונים על התוצאות שנמצאו.

מתאים ל

  • חיפוש במצגות ותרשימים

    איתור שקפים לפי תוכן ויזואלי, גרפים וטבלאות שהמרת טקסט רגילה מפספסת בדרך כלל.

  • בדיקת איכות למודל

    בחינה מעשית של יכולות colqwen2-v1.0 באחזור מסמכים מורכבים לפני הטמעה בפרויקט.

  • סריקת מאמרים טכניים

    מציאת עמודים עם נוסחאות ותרשימי זרימה בתוך קובצי מאמרים אקדמיים לפי שאילתה פשוטה.

איפה זה נופל

בקוד יש בדיקה מפורשת שמגבילה את כמות העמודים הכוללת שניתן להעלות, כך שהיא לא מתאימה לספרים שלמים או לארכיונים כבדים. אם תנסו לחפש לפני שביצעתם אינדוקס, או שתשלחו שאילתה ריקה, תקבלו שגיאה ישירה בממשק. בנוסף, מדובר בהדגמת אחזור בלבד, והיא מחזירה תמונות של עמודים ולא מייצרת תשובה טקסטואלית מנוסחת.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, הגישה בדפדפן פתוחה ללא תשלום. המשאבים מוקצים על גבי תשתית ענן שיתופית עם חומרת A10G. אם תרצו היקף עבודה רחב או קבוע, תצטרכו להקים שרת משלכם.

מה קורה למסמכים שמעלים לשם?

הקבצים נשלחים לשרת שבו רץ הקוד, ושם הם מומרים לתמונות לצורך חישוב הווקטורים. המידע נשמר בזיכרון הריצה של ההדגמה כל עוד ה־session פעיל. לא כדאי להעלות לשם מסמכים אישיים או קבצים פנימיים של עבודה.

האם אפשר להריץ את זה על המחשב?

כן, הקוד מבוסס על ספריות פתוחות כמו colpali-engine ופועל עם המודל vidore/colqwen2-v1.0. עם זאת, הרצה מקומית דורשת כרטיס מסך חזק כדי לבצע את חישובי התמונה והטקסט בקצב סביר. במחשב רגיל ללא GPU מתאים זה ירוץ לאט מאוד.

במה זה שונה ממערכות חיפוש מסמכים רגילות?

כלים ישנים מחלצים את הטקסט מהקובץ ומתעלמים מהעיצוב שלו לחלוטין. הכלי הזה מתייחס לכל עמוד כאל תמונה ולומד את המבנה הגרפי, המיקום והטיפוגרפיה. זה מאפשר לו למצוא מידע שנמצא בתוך איורים או דיאגרמות בלי להסתמך על OCR.

איך משתמשים

גוררים קובצי PDF לממשק ולוחצים על כפתור האינדוקס. ההדגמה רצה על מאיץ מסוג zero-a10g שמוקצה לפי דרישה ברגע שלוחצים על פעולה, כך שייתכן עיכוב קל בהפעלה הראשונית של המעבד הגרפי.

לאחר שהאינדוקס מסתיים, מקלידים שאילתה בשדה החיפוש, מכוונים את כמות התוצאות ולוחצים על כפתור החיפוש. אין צורך לפתוח חשבון, אבל בממשק קיים שדה להזנת מפתח API.

הרישיון

הרישיון של ההדגמה לא דווח בעמוד. המשמעות היא שאין הרשאה ברורה לשימוש מסחרי בקוד עצמו. כל קובץ PDF שאתם מעלים נשלח לתשתית שעליה רץ השרת, ולכן לא מומלץ להעלות מסמכים רגישים או מידע פרטי.

הרישיון המלא ב־Hugging Face ↗