GPT
C

colpali-v1.2

קוד פתוח

vidoremit2024-08-26

  • colpali
  • safetensors
  • vidore
  • vidore-experimental
  • sentence-transformers

המודל הזה מאנדקס עמודי מסמכים ישירות מתמונות בעזרת ייצוג רב-וקטורי. הוא פותר את הצורך בחילוץ טקסט ו־OCR כשרוצים לאחזר קובצי PDF מורכבים.

  • 319 MBמשקל הקבצים
  • 37,023הורדות בחודש
  • 113לייקים

מה זה

הארכיטקטורה כאן מחברת בין מודל הראייה SigLIP לבין מודל השפה PaliGemma-3B כדי להמיר טלאים של תמונת עמוד למרחב וקטורי דומה לזה של שאילתת טקסט. במקום להפיק וקטור יחיד לכל דף, הוא מייצר ייצוג ColBERT שמאפשר אינטראקציה מאוחרת בין מילות השאילתה לחלקי התמונה. המטרה היא לעקוף את צוואר הבקבוק של חילוץ טקסט שגוי מטבלאות או תרשימים.

גרסה 1.2 מתקנת בעיות של טוקנים לא רצויים בקידוד השאילתות באמצעות ריפוד מימין, ומקבעת את אתחול שכבת ההיטל כדי לתת תוצאות דטרמיניסטיות. המאמנים השתמשו בחימום ארוך פי עשרה כדי לצמצם קריסה בשפות שאינן אנגלית, לצד דוגמאות שליליות קשות שנכרו ישירות מתוך הנתונים.

מתאים ל

  • אחזור דוחות וקובצי PDF

    אינדוקס ישיר של מסמכים עם גרפים וטבלאות ללא צורך בשכבת OCR נפרדת.

  • מנועי חיפוש רב-וקטוריים

    שליפת עמודים באמצעות חישובי late interaction שמשווים מילות שאילתה לטלאי תמונה.

  • בניית מאגרי RAG לתמונות

    שילוב מסמכים מצולמים בתוך צינור מידע המבוסס על מודלי שפה וראייה.

איפה זה נופל

הנתונים ששימשו לאימון כללו אנגלית בלבד מתוך כוונה לבחון הכללה לשפות אחרות. המשמעות עבור עברית ברורה. המודל עלול להציג ביצועים ירודים מול טקסט מקומי, למרות שהבסיס שלו כולל שפות נוספות. כמו כן, הוא תוכנן כמעט אך ורק סביב דפי PDF ותחביר חזותי של מסמכים, ולא יתאים לתמונות כלליות מהעולם האמיתי.

בנוסף, שיטת השליפה הרב-וקטורית דורשת מנועי חיפוש שתומכים בחישובי אינטראקציה מאוחרת בסגנון ColBERT. רוב מסדי הנתונים הווקטוריים הסטנדרטיים לא מציעים את זה ישירות מהקופסה, מה שיחייב אתכם להרים תשתית ייעודית לאחסון ולחישוב.

אותה משפחה

colpali יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה כפי שהוא?

לא. המשקל שמורידים מכיל רק מתאמי LoRA בגודל של כ־319 מגה-בייט. תצטרכו להוריד בנפרד את מודל הבסיס PaliGemma-3B כדי לחבר אליו את השכבות הללו.

האם המודל תומך במסמכים בעברית?

אימון המודל נעשה על 127,460 צמדי שאילתות ודפים באנגלית בלבד. אף על פי שמודל השפה המקורי נחשף למספר שפות, המפתחים מזהירים מפני ירידה ביכולות בשפות פחות נפוצות, ולכן חובה לבדוק אותו על עמודי דוגמה בעברית לפני שמסתמכים עליו.

איך מריצים

המשקל של הקבצים קטן, סך הכול 319 מגה-בייט, כי מדובר במתאמי LoRA בלבד ולא בכל המשקלים של מודל הבסיס. כדי להריץ אותם תצטרכו לטעון את PaliGemma-3B המקורי בסביבה שתומכת ב־bfloat16, רצוי על גבי כרטיס מסך עם זיכרון ייעודי לעבודה עם מודלי תמונה ושפה.

אפשר להשתמש בספריית Sentence Transformers החל מגרסה שש עם תמיכה בתמונות, או בספרייה colpali-engine. שימו לב ששינויים בגרסאות המאוחרות של colpali-engine הסירו קידומות שאילתה וסיומות שורות שהמודל הזה אומן עליהן, מה שיוצר סטיות קלות בוקטורים לעומת המימוש המקורי.

pip install -U huggingface_hub
hf download vidore/colpali-v1.2

הרישיון

המתאמים שפורסמו כאן מופצים תחת רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה כמעט ללא הגבלות. עם זאת, השימוש בפועל מחייב טעינה של מודל הבסיס PaliGemma, והוא כפוף לתנאי הרישיון המקוריים של Gemma מבית גוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗