GPT
C

colqwen2-v0.1

קוד פתוח

vidoreapache-2.02024-09-26

  • colpali
  • safetensors
  • vidore
  • vidore-experimental
  • sentence-transformers

הוא מאנדקס דפי מסמכים ותמונות ישירות כווקטורים בשיטת ColBERT בלי לעבור דרך OCR. הפתרון מתאים למי שרוצה שליפה חזותית מהירה של קובצי PDF על בסיס מודל קל משקל.

  • 294 MBמשקל הקבצים
  • 10,355הורדות בחודש
  • 197לייקים

מה זה

המודל מתבסס על Qwen2-VL-2B ומוסיף לו שכבת הטלה שמפיקה ייצוג מרובה וקטורים לטקסט ולתמונות. במקום לחלץ טקסט עם כלי OCR נפרד ואז לאבד את העימוד, הגרפים והטבלאות, הוא מקבל את עמוד המסמך ישירות כתמונה ומייצר וקטורים שמייצגים גם את התוכן וגם את המבנה החזותי.

האימון נעשה על 127,460 צמדים של שאילתות ועמודים, שחלקם נלקחו ממאגרים אקדמיים פתוחים וחלקם מקובצי PDF עם שאלות סינתטיות שנוצרו על ידי Claude-3 Sonnet. בניגוד למודלים שמכריחים שינוי גודל ופוגעים ביחס התמונה, הוא תומך ברזולוציה דינמית ומייצר עד 768 פאצ'ים חזותיים לכל עמוד, מה שמשפר את הדיוק על חשבון צריכת הזיכרון.

הכרטיס מציין שזו גרסת הבסיס שנועדה לאתחול דטרמיניסטי של שכבת ההטלה. המודל מתמקד בשפה האנגלית, ולמרות שמודל הבסיס ראה שפות נוספות, הנתונים הייעודיים לאימון השליפה היו כולם באנגלית בלבד.

מתאים ל

  • שליפת עמודי PDF מורכבים

    חיפוש מדויק במסמכים עם טבלאות, דיאגרמות וגרפים בלי להסתמך על כלי OCR שנוטים לשבש מבנים.

  • אינדוקס מסמכים באנגלית

    שליפת מידע ממסמכים טכניים באנגלית בעזרת מודל קל שמפיק ייצוג מרובה וקטורים לכל עמוד.

  • אימון והתאמה אישית

    שימוש במשקלים הבסיסיים כנקודת מוצא מכוילת היטב לכוונון עדין על מסמכים פנים ארגוניים.

איפה זה נופל

האימון נעשה כולו באנגלית, ולכן ביצועים בעברית אינם מובטחים ונשענים רק על מה שמודל הבסיס קלט במקרה. בנוסף, מנגנון late interaction של ColBERT דורש טיפול מיוחד. רוב מסדי הנתונים הווקטוריים הסטנדרטיים לא יודעים לאחסן ולחפש מספר רב של וקטורים עבור רשומה אחת בלי התאמות קוד כבדות.

קיימת גם בעיית תאימות מוצהרת בגרסאות. החל מגרסה 0.3.13 של colpali-engine הוסרה הקידומת של השאילתה שהמודל אומן איתה, מה שיוצר פער בביצועים לעומת Sentence Transformers אם לא שמים לב להגדרות המדויקות בזמן הריצה.

אותה משפחה

colqwen2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך במסמכים ושאילתות בעברית?

האימון הייעודי נעשה באנגלית בלבד. מודל הבסיס נחשף לנתונים רב לשוניים, אך הביצועים על מסמכים בעברית לא נבדקו באופן רשמי ודורשים בדיקה זהירה לפני שימוש.

למה הקבצים שוקלים פחות מ־300 מגה בייט?

המאגר כולל רק את משקלי המתאם של LoRA ואת שכבת ההטלה, ולא את כל מודל Qwen2-VL-2B. בזמן הטעינה הקוד מושך את מודל הבסיס בנפרד ומלביש עליו את השכבות האלה.

איך מריצים

המשקל הכולל של הקבצים כאן עומד על 294 מגה בייט בלבד, מכיוון שמדובר במשקלי מתאם LoRA ושכבת היטל שמתלבשים על מודל הבסיס. כדי להריץ אותו צריך לטעון את מודל השפה החזותי המלא ולהשתמש בספריית colpali-engine מגרסה 0.3.1 ומעלה, או בגרסה עדכנית של sentence-transformers.

האימון עצמו בוצע בפורמט bfloat16 על שמונה מעבדים גרפיים עם אופטימייזר של שמונה ביט. לצורך הרצה והסקה מספיק כרטיס מסך ביתי בודד עם זיכרון סביר, אבל האתגר האמיתי מגיע בשמירת האינדקס, שמצריך שמירה של עשרות עד מאות וקטורים לכל עמוד מסמך ולא וקטור יחיד.

pip install -U huggingface_hub
hf download vidore/colqwen2-v0.1

הרישיון

מודל הבסיס מוגדר תחת רישיון Apache 2.0, ואילו מתאמי ה־LoRA הנוספים מפורסמים תחת רישיון MIT. שני הרישיונות מתירים שימוש מסחרי חופשי, שינוי והפצה, בתנאי ששומרים על הצהרות זכויות היוצרים המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗