GPT
C

colnomic-embed-multimodal-7b

קוד פתוח

nomic-aiapache-2.02025-03-31

  • peft
  • safetensors
  • vidore
  • colpali
  • multimodal_embedding

מודל שיודע לאנדקס ישירות עמודי מסמכים כקובצי תמונה בלי לעבור דרך OCR. הוא מייצר ייצוג רב-וקטורי ומביא את הציון הגבוה ביותר במבחן Vidore-v2 מבין המודלים שנבדקו.

  • 324 MBמשקל הקבצים
  • 834הורדות בחודש
  • 107לייקים

מה זה

המודל מבוסס על Qwen2.5-VL 7B Instruct ועבר אימון ייעודי לאחזור מסמכים ויזואליים. במקום להוציא טקסט גולמי מקובץ PDF ולאבד את המבנה, שולחים אליו את העמוד כתמונה יחד עם הטקסט, והוא מקודד גרפים, דיאגרמות, טבלאות ונוסחאות כיחידה אחת. הארכיטקטורה מפיקה מספר וקטורים לכל עמוד כדי לשמור על קשר בין רכיבים ויזואליים למונחים כתובים.

במבחן הביצועים Vidore-v2 הוא מוביל את הטבלה עם ציון ממוצע של 62.7 ב־NDCG@5, מעל מתחרים כמו Voyage Multimodal 3 שקיבל 55.0 ו־GME Qwen2 7B שעומד על 59.0. היתרון הגדול שלו מתבטא בעיקר במסמכים אמיתיים, שם הוא מגיע ל־73.9 בקטגוריית ESG מול 65.8 של גרסת ה־3B.

מתאים ל

  • חיפוש בדוחות כספיים

    מאנדקס גרפים, טבלאות נתונים והערות שוליים מתוך דוחות סרוקים ישירות מתמונת העמוד.

  • אחזור במאמרי מחקר

    מאתר נוסחאות מתמטיות, תרשימי זרימה ודיאגרמות שתוכנות OCR רגילות נוטות לשבש.

  • אינדוקס קטלוג מוצרים

    מחבר בין תמונת המוצר למפרט הטכני שמופיע לצדו באותו העמוד.

איפה זה נופל

עברית בכלל לא מופיעה ברשימת השפות הנתמכות, שכוללת רק אנגלית, איטלקית, צרפתית, גרמנית וספרדית. המפתחים מציינים בפירוש שהביצועים החזקים ביותר נשמרים לאנגלית בלבד, ושכתב יד או גופנים מעוצבים מדי פוגעים באיכות האחזור. בנוסף, מסמכים מורכבים במיוחד או כאלה עם פריסה גרפית חריגה עדיין מחייבים חיתוך ידני לחלקים קטנים יותר, והגישה הרב-וקטורית דורשת נפח אחסון גדול בהרבה מאינדקס וקטורי רגיל.

אותה משפחה

colnomic-embed-multimodal יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח לקרוא מסמכים סרוקים בעברית?

המודל אומן ותועד רק עבור אנגלית, איטלקית, צרפתית, גרמנית וספרדית, והביצועים הטובים שלו מובטחים בעיקר באנגלית. מסמכים בעברית עלולים להניב תוצאות אחזור חלשות או לא מדויקות, ולכן לא מומלץ להסתמך עליו למסמכים מקומיים בלי בדיקה מעמיקה.

למה קובץ ההורדה שוקל רק 324 מגה-בייט למודל של 7B?

המאגר מכיל רק משקלי התאמה של ספריית PEFT, כלומר מתאמי LoRA ולא את המודל השלם. בזמן הטעינה תצטרכו להוריד בנפרד את מודל הבסיס Qwen2.5-VL 7B Instruct, ששוקל עשרות גיגה-בייט, ולהלביש עליו את השכבה הזו.

איך מריצים

המשקל של המאגר עומד על 324 מגה-בייט בלבד ב־16 קבצים כי מדובר בשכבת התאמה מסוג PEFT, מתאמי LoRA, ולא בכל משקלי המודל הבסיסי. כדי להשתמש בו צריך להוריד את מודל הבסיס Qwen2.5-VL 7B ולהתקין את ספריית colpali ישירות ממאגר הגיטהאב של illuin-tech.

מבחינת חומרה, הרצת מודל בסיס של שבעה מיליארד פרמטרים עם תמונות ברזולוציה מלאה דורשת כרטיס מסך עם לפחות 16 עד 24 גיגה-בייט זיכרון וידאו בשביל אינדוקס סביר. אם אין לכם שרת ייעודי זמין לפעולות כבדות כאלה, עדיף להשתמש בפתרון ענן מנוהל או בשירות שמחזיק את המודל פתוח.

pip install -U huggingface_hub
hf download nomic-ai/colnomic-embed-multimodal-7b

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פרטיים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לחשוף את הקוד של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗