GPT
C

colqwen2.5-v0.2

קוד פתוח

vidoremit2025-01-31

  • colpali
  • safetensors
  • vidore
  • vidore-experimental
  • sentence-transformers

המודל מאנדקס עמודי מסמכים ישירות מתמונות בלי צורך בפירוק טקסט וטבלאות בנפרד. הוא משתמש בייצוג מרובה וקטורים כדי לחפש מדויק בתוך קבצי PDF מורכבים.

  • 245 MBמשקל הקבצים
  • 293,341הורדות בחודש
  • 101לייקים

מה זה

מדובר במודל אחזור ויזואלי שמבוסס על מודל השפה והראייה Qwen2.5-VL-3B בתוספת מתאמי LoRA. במקום להמיר קובץ PDF לטקסט רציף ולאבד בדרך תרשימים וטבלאות, הוא מקבל את תמונת העמוד ומייצר ייצוגי וקטורים מרובים בסגנון ColBERT. החידוש כאן מול גרסאות קודמות הוא התמודדות עם רזולוציה דינמית שלא משנה את יחס הגובה והרוחב של התמונה המקורית.

הוא מוגבל לתקרה של 768 טלאי תמונה לכל עמוד כדי לא לחנוק את הזיכרון. האימון שלו נשען על כמעט 127,500 זוגות של שאילתות ועמודים, שחלקם הגדול אקדמי וחלקם מורכב מעמודי רשת עם שאלות סינתטיות שנוצרו במודל חיצוני.

מתאים ל

  • אחזור עמודי PDF באנגלית

    הוא קורא את העמוד כתמונה ומחזיר תוצאות מדויקות גם כשיש תרשימים וטבלאות מסובכות.

  • חיפוש מבוסס Late Interaction

    התאמה מלאה למי שמשתמש במנגנוני ColBERT ומחפש התאמה מקומית בין מילים לפרטים בתמונה.

  • מערכות RAG ללא OCR מקדים

    חוסך את שלב חילוץ הטקסט ומאפשר לגשת ישירות לעמודים סרוקים שמכשילים מנועי טקסט רגילים.

איפה זה נופל

האימון נעשה כולו באנגלית בלבד, ודפי הבדיקה מבוססים בעיקר על מסמכי PDF רגילים. אם תזרקו עליו עמודים בעברית או תבניות מסמך חריגות, אתם מסתמכים נטו על הידע המוקדם של מודל הבסיס בלי שום בדיקה ייעודית. בנוסף, מנגנון האינטראקציה המאוחרת מייצר עשרות ומאות וקטורים לכל עמוד, מה שמסבך את התשתית בבסיסי נתונים וקטוריים סטנדרטיים וגוזל נפח אחסון גבוה משמעותית בהשוואה לווקטור בודד.

שאלות
נפוצות

האם המודל כולל בתוכו את כל המשקלים ומוכן לריצה?

לא, ההורדה הזו שוקלת רק 245 מגה בייט וכוללת את משקלי ה־LoRA בלבד. בזמן הריצה צריך להוריד ולטעון בנוסף את מודל הבסיס Qwen2.5-VL-3B.

איך המודל מתמודד עם חיפוש במסמכים בעברית?

האימון הספציפי שלו נבנה כולו על נתונים באנגלית בלבד. כל יכולת בעברית תלויה לחלוטין במה שמודל הבסיס למד לפני כן, ולכן צריך לבדוק אותו מקומית לפני שבונים עליו.

איך מריצים

המשקל של הקבצים קטן מאוד, 245 מגה בייט, כי מדובר רק במשקלי המתאמים ולא במודל הבסיס כולו. להרצה תצטרכו לטעון את Qwen2.5-VL-3B יחד איתם, מה שדורש מעבד גרפי עם מספיק זיכרון וידאו בשביל מודל של שלושה מיליארד פרמטרים וטלאי תמונה ברזולוציה מלאה.

אפשר להריץ אותו עם ספריית colpali-engine מגרסה 0.3.1 ומעלה, או ישירות דרך Sentence Transformers מגרסה 6 ומעלה. שימו לב להבדל בגרסאות הספריות סביב הקידומת של השאילתה, שמשפיע על הווקטורים שנוצרים.

pip install -U huggingface_hub
hf download vidore/colqwen2.5-v0.2

הרישיון

המתאמים שפורסמו כאן מופצים ברישיון MIT חופשי, אבל מודל הבסיס Qwen2.5-VL כפוף לרישיון המחקר של Qwen. המשמעות היא שאי אפשר לקחת את החבילה הזו כמו שהיא למוצר מסחרי סגור בלי לבדוק ולקבל את תנאי השימוש והמגבלות של מודל הבסיס עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗