GPT
C

colpali

קוד פתוח

vidoremit2024-06-25

  • colpali
  • safetensors
  • vidore
  • sentence-transformers
  • multi-vector

חיפוש ישיר במסמכים סרוקים ובקובצי PDF לפי המראה הוויזואלי שלהם, בלי צורך לחלץ טקסט בנפרד. המודל מחבר מודל שפה חזותי עם גישת ריבוי וקטורים כדי להבין טבלאות, דיאגרמות ועיצוב עמוד שלם.

  • 97.3 MBמשקל הקבצים
  • 3,510הורדות בחודש
  • 487לייקים

מה זה

במקום לפרק מסמך לטקסט גולמי באמצעות תוכנות זיהוי תווים, המודל הזה מתייחס לכל עמוד כאל תמונה מלאה. הוא מבוסס על PaliGemma 3B ומשלב עיבוד של טלאי תמונה מודל SigLIP יחד עם שכבות השפה של המודל. הגישה הזו ממפה את הווקטורים של חלקי התמונה ישירות לאותו מרחב סמנטי של מילות השאילתה, וכך נשמר ההקשר הוויזואלי של טבלאות, תרשימים ופריסת עמוד שלרוב הולכים לאיבוד בעיבוד טקסטואלי רגיל.

הייחוד המרכזי כאן מגיע משימוש במנגנון האינטראקציה המאוחרת של ColBERT. במקום לדחוס עמוד שלם לוקטור בודד שמפספס פרטים קטנים, נוצר סט וקטורים נפרד עבור כל מקטע בתמונה. ההשוואה מול שאילתת החיפוש מתבצעת ברמת התאמה פרטנית בין מילים לבין אזורים ספציפיים בעמוד. אימון המודל נעשה על 127,460 צמדי עמוד ושאילתה, תוך שימוש במתאמי LoRA ברמת דיוק bfloat16 על גבי מודל הבסיס.

מתאים ל

  • שליפת דוחות ומסמכים כספיים

    איתור עמודים עם טבלאות וגרפים שאי אפשר לחלץ בצורה אמינה באמצעות OCR רגיל.

  • אינדוקס שרטוטים ומפרטים

    התאמת שאילתת טקסט למבנה הוויזואלי של עמוד טכני מורכב.

  • מנוע חיפוש פנימי ל־PDF

    סריקה ישירה של ארכיון קבצים ללא שלב מקדים של המרת טקסט ופילוח ידני.

איפה זה נופל

המגבלה הכי גדולה היא הדרישה לתשתית שמסוגלת לנהל חיפוש של ריבוי וקטורים. רוב בסיסי הנתונים הווקטוריים הנפוצים בנויים לוקטור יחיד לכל מסמך, וכאן כל עמוד מייצר עשרות וקטורים שמנפחים את האינדקס ודורשים חישוב כבד יותר בשליפה. בנוסף, כל נתוני האימון היו באנגלית בלבד. אמנם מודל הבסיס נחשף לשפות נוספות לפני כן, אבל ההתאמה לעברית אינה מובטחת כלל ולא נבדקה רשמית. נקודה נוספת היא התמקדות בלעדית בקובצי PDF, כך שסוגי מדיה אחרים יניבו ביצועים נחותים.

אותה משפחה

colpali יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יפעל טוב על מסמכים בעברית?

האימון הרשמי של המודל נעשה כולו על נתונים באנגלית בלבד. מודל הבסיס כולל ידע רב לשוני מוקדם, אך ההתאמה הוויזואלית למסמכים ולטקסטים בעברית לא נבדקה ועלולה להציג ביצועים נמוכים מאוד.

למה גודל הקובץ להורדה הוא רק עשרות מגה בייטים?

המאגר מכיל רק את משקולות המתאמים בשיטת LoRA ולא את המודל המלא. כדי להפעיל אותו יש להוריד במקביל את מודל הבסיס PaliGemma 3B שדורש חומרה מתאימה להרצת מודל של כשלושה מיליארד פרמטרים.

איך מריצים

המשקל של הקבצים קטן יחסית, 97.3 מגה בייט בלבד, מכיוון שמדובר רק במתאמי LoRA ושכבת היטל, ולא בכל המשקולות של PaliGemma 3B. בפועל חייבים לטעון את מודל הבסיס השלם, ולכן נדרש מעבד גרפי עם מספיק זיכרון להרצת מודל של שלושה מיליארד פרמטרים. ניתן להריץ אותו ישירות דרך Sentence Transformers מגרסה שש ומעלה עם תמיכה בריבוי וקטורים.

אם בוחרים להשתמש בספריית המקור colpali engine, חשוב לשים לב שהצ'קפוינט הזה תואם ספציפית לגרסה 0.1.1. בגרסאות חדשות יותר הסירו תחיליות ורווחים שהמודל הזה עדיין מסתמך עליהם, מה שפוגע בדיוק התוצאות. בנוסף, המפתחים עצמם מציינים שקיימות גרסאות עדכניות יותר כמו v1.2.

pip install -U huggingface_hub
hf download vidore/colpali

הרישיון

המתאמים עצמם מפורסמים תחת רישיון MIT שמאפשר שימוש חופשי, כולל שימוש מסחרי, שינוי קוד והפצה. עם זאת, אי אפשר להריץ אותם בלי מודל הבסיס PaliGemma 3B, והוא כפוף לתנאי הרישיון הייעודיים של Gemma. מי שמתכנן לשלב את המערכת במוצר מסחרי חייב לציית למגבלות השימוש וההפצה של גוגל עבור מודלי Gemma.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗