GPT
V

vdr-2b-multi-v1

קוד פתוח

llamaindexapache-2.02025-01-08

  • sentence-transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • transformers

הופך צילומי מסמכים לווקטורים ישירות, בלי לפצל לפסקאות ובלי תהליכי OCR מורכבים. הוא מתאים למי שבונה חיפוש במסמכים עמוסי גרפים וטבלאות בחמש שפות אירופיות.

  • 2.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 4.1 GBמשקל הקבצים
  • 1,586הורדות בחודש

מה זה

במקום להריץ צינור עיבוד שלם שמחלץ טקסט מתמונות ומאבד את העימוד בדרך, המודל מקודד עמוד שלם לתוך וקטור יחיד. הבסיס שלו הוא ארכיטקטורת Qwen2-VL עם 2.2 מיליארד פרמטרים, והוא אומן על חצי מיליון זוגות של תמונות ושאילתות באנגלית, איטלקית, צרפתית, גרמנית וספרדית. הוא תומך גם בחיפוש בין שפות שונות, כך שאפשר להזין שאילתה באיטלקית ולקבל מסמך מקביל בגרמנית.

במדדי ההערכה מול מודל הבסיס שלו dse-qwen2-2b-mrl-v1, הוא מציג שיפור עקבי בשפות האירופיות, עם ממוצעי NDCG@5 שנעים בין 95.6 ל־98.1. באנגלית השיפור זניח, עשירית האחוז בלבד, אבל בגרמנית ובצרפתית הוא מרוויח בין שניים לשלושה אחוזים. מעבר לזה, המודל תומך בצמצום וקטורים פי שלושה תוך שמירה על 98% מאיכות הייצוג, מה שחוסך מקום במסד הנתונים הווקטורי.

מתאים ל

  • חיפוש בקטלוגים ודוחות

    שליפת עמודים שלמים המכילים גרפים וטבלאות באנגלית או גרמנית בלי להסתמך על תוכנת OCR חיצונית.

  • שליפה חוצת שפות באירופה

    חיפוש מסמכים טכניים שנכתבו בספרדית באמצעות שאילתות חיפוש באנגלית או צרפתית.

  • אינדוקס חסכוני בווקטורים

    שימוש בטכניקת המטריושקה לצמצום גודל הווקטור פי שלושה כדי להוזיל את עלויות האחסון במסד הנתונים.

איפה זה נופל

החיסרון המרכזי למפתח הישראלי הוא היעדר מוחלט של עברית, המודל אומן ונבדק על חמש שפות אירופיות בלבד. בנוסף, בביצועים על משימות הבנה ויזואלית מורכבות כמו docvqa ו־tatdqa התוצאות נמוכות יחסית, עם ציונים של 58.5 ו־53.6 בהתאמה. יש גם ירידות קלות במדדים מסוימים כמו תחום הבריאות או האנרגיה בהשוואה למודל הבסיס שלו, כך שחובה לבדוק אותו על סוג המסמכים הספציפי שלכם.

שאלות
נפוצות

האם המודל תומך במסמכים בעברית?

המודל לא אומן על עברית ולא נבדק עליה. רשימת השפות הנתמכות כוללת אנגלית, צרפתית, גרמנית, ספרדית ואיטלקית בלבד, ולכן הוא לא יתאים למסמכים מקומיים.

כמה זיכרון גרפי נדרש בפועל להרצה?

במצב מנוחה המודל דורש כ־4.4 גיגה בייט בפורמט bfloat16. להרצה שוטפת בגודל אצווה של 16 תמונות תצטרכו כרטיס עם לפחות 12 גיגה בייט זיכרון גרפי, כמו NVIDIA T4.

איך מריצים

בטעינה לזיכרון בפורמט bfloat16 המודל תופס בערך 4.4 גיגה בייט. בריצת עיבוד עם 768 פאצ'ים לתמונה וגודל אצווה של 16, צריכת הזיכרון מגיעה ל־11.5 גיגה בייט, כך שכרטיס כמו NVIDIA T4 זול מספיק בשבילו. אם מגדילים את גודל האצווה ל־32, נדרשים כבר 19.7 גיגה בייט של זיכרון גרפי.

אפשר להריץ אותו דרך Hugging Face Transformers, Sentence Transformers או ישירות באמצעות LlamaIndex. אם אין לכם גישה לכרטיס מסך ייעודי של לפחות 12 גיגה בייט ואין לכם צורך בעיבוד מקומי מטעמי פרטיות, עדיף להשתמש במודל חיצוני דרך שרת ענן.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("llamaindex/vdr-2b-multi-v1")
v = m.encode(["שלום עולם"])

הרישיון

הקוד והמשקלים מופצים תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. הדרישה העיקרית היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗