GPT
C

colpali-v1.3

קוד פתוח

vidoremit2024-11-08

  • colpali
  • safetensors
  • vidore
  • vidore-experimental
  • sentence-transformers

מודל חיפוש ואחזור שמסתכל על עמודי מסמכים כתמונות במקום לפרק אותם לטקסט ב־OCR. הוא מחבר שאילתות טקסט ישירות לחלקים ויזואליים בעמוד בשיטת ColBERT.

  • 109 MBמשקל הקבצים
  • 17,229הורדות בחודש
  • 100לייקים

מה זה

המודל לוקח עמודי מסמכים מלאים, סורק אותם עם מודל ראייה SigLIP ומעביר את המידע דרך PaliGemma-3B. במקום להוציא וקטור יחיד לכל עמוד, הוא מייצר ייצוג של מספר וקטורים במקביל לפי טלאי תמונה וטוקנים של טקסט, ומאפשר אינטראקציה מאוחרת בסגנון ColBERT. המשמעות היא שהשאילתה מתאימה את עצמה ישירות לאלמנטים גרפיים, כותרות או טבלאות בתוך העמוד בלי תלות באיכות הפענוח של מנוע טקסט נפרד.

גרסה 1.3 מבוססת על אימון עם תיקון לריפוד ימני בשאילתות כדי למנוע טוקנים זבל בקידוד, יחד עם אתחול דטרמיניסטי לשכבת ההקרנה. האימון נמשך חמישה מחזורים וכלל דגימות שליליות קשות וחימום של אלף צעדים שנועד לצמצם קריסה בשפות שאינן אנגלית. סט הנתונים כלל 127,460 זוגות של שאילתות ועמודים, חלקם אקדמיים פתוחים וחלקם עמודי PDF סינתטיים עם שאלות שנוצרו באמצעות קלוד 3 סונט.

מתאים ל

  • חיפוש בדו״חות עם גרפים

    הוא מאתר נתונים ישירות מאינפוגרפיקה ודיאגרמות בלי להסתמך על תוכנת OCR שקורסת בעיצוב מורכב.

  • אחזור מסמכי PDF מורכבים

    שומר על הקשר ויזואלי של טבלאות וטפסים מרובי טורים שלא עוברים טוב המרה לטקסט רגיל.

  • שלב אחזור למערכות RAG

    שולף את עמודי המקור המדויקים ביותר לפי שאילתת משתמש לפני שליחתם למודל שפה שמנסח תשובה.

איפה זה נופל

האימון נעשה אך ורק באנגלית. היכולת בשפות אחרות כמו עברית נשענת על הידע המוקדם של גמה ופליגמה, כך שאי אפשר לסמוך עליו במסמכים מקומיים בלי בדיקה ידנית מעמיקה. בנוסף, המודל מתמקד בקובצי PDF טיפוסיים ובשפות נפוצות. החיסרון התפעולי הכבד ביותר הוא שיטת הווקטורים המרובים. רוב מסדי הנתונים הווקטוריים הסטנדרטיים מותאמים לווקטור בודד למסמך, ודרישת החישוב של אינטראקציה מאוחרת מצריכה תשתית אחסון וחיפוש שונה לגמרי מהמקובל בצוותי פיתוח.

אותה משפחה

colpali יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל שוקל רק 109 מגה בייט?

לא. הקבצים כאן כוללים רק את משקלי ה־LoRA ושכבת ההקרנה. בעת הטעינה נמשך גם מודל הבסיס PaliGemma-3B ששוקל כמה גיגה בייטים ודורש כרטיס מסך בהתאם.

האם אפשר להשתמש במודל לאחזור מסמכים בעברית?

האימון של גרסה 1.3 כלל שאילתות ומסמכים באנגלית בלבד. המפרסמים ניסו לצמצם קריסה בשפות זרות באמצעות חימום ארוך, אבל ביצועים בעברית יהיו מבוססים על מה שפליגמה מכיר מראש ועלולים להיות חלשים משמעותית.

איך מריצים

המשקל שמופץ כאן הוא בסך הכול 109 מגה בייט כי מדובר במתאמי LoRA בלבד, שמתלבשים על מודל הבסיס PaliGemma-3B. אפשר להריץ אותו דרך ספריית colpali-engine בגרסאות בין 0.3.0 ל־0.4.0, או דרך Sentence Transformers מגרסה 6.0 ומעלה עם התקנת רכיבי התמונה.

כדי להריץ אותו בפועל תצטרכו לטעון את מודל הבסיס שדורש מעבד גרפי של 8 עד 16 גיגה זיכרון וידאו, תלוי ברמת הדיוק. שימו לב שבגרסאות חדשות של colpali-engine הוסרו התחילית והירידה לשורה שבהן השתמשו באימון המקורי, בעוד התצורה של Sentence Transformers משחזרת את הפורמט המדויק ומזריקה token type ids שמונעים בעיות במיסוך תשומת הלב מול שאילתות קצרות.

pip install -U huggingface_hub
hf download vidore/colpali-v1.3

הרישיון

המתאמים שמפורסמים כאן מוצעים תחת רישיון MIT שמאפשר שימוש מסחרי, שינוי והפצה כמעט ללא הגבלה. עם זאת, מודל הבסיס PaliGemma מוגן ברישיון הייעודי של גמה מבית גוגל. אי אפשר להשתמש במודל בלי להוריד את הבסיס, ולכן אתם מחויבים לתנאי השימוש וההגבלות של גוגל לפני הפצה במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗