GPT
G

gme-Qwen2-VL-2B-Instruct

קוד פתוח

Alibaba-NLPapache-2.02024-12-21

  • sentence-transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • mteb

מודל שיודע לייצר וקטורים גם מטקסט וגם מתמונות, על בסיס ארכיטקטורה ויזואלית קטנה. הוא מתאים למי שבונה חיפוש סמנטי משולב ורוצה מודל פתוח שאפשר לדחוף לכרטיס מסך ביתי.

  • 2.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 8.2 GBמשקל הקבצים
  • 19,047הורדות בחודש

מה זה

מדובר במודל הטמעה שנבנה על בסיס מודל הראייה והשפה של עליבאבא, עם 2.2 מיליארד פרמטרים. במקום לעבוד רק על טקסט כמו רוב מודלי הדמיון הסמנטי הנפוצים, הוא מעבד גם תמונות ומחזיר ייצוג וקטורי שמאפשר להשוות ביניהם. חלון ההקשר מגיע ל־32,768 טוקנים, כך שאפשר להזין מסמכים ארוכים מאוד או שילובים כבדים של תוכן ויזואלי וטקסט בלי לחתוך אותם מראש.

במדדי ההערכה הרשמיים רואים שהוא מתפקד טוב במיוחד במשימות דירוג מחדש בסינית, עם תוצאות MRR של סביב 88 עד 89 נקודות במאגרים רפואיים, וסיווג מדויק של מעל 96 אחוזים בקוטביות ביקורות באנגלית. מנגד, באחזור נתונים טכניים באנגלית מתוך מאגרי שאלות ותשובות התוצאות צנועות בהרבה, עם ציון MAP שעומד לעיתים על 16 עד 30 נקודות בלבד. זה אומר שהוא מצטיין בהבנת כוונות וסיווג, אבל בשליפה מדויקת של פריט בודד מתוך ערימה גדולה כדאי לבדוק אותו היטב מול הנתונים שלכם.

מתאים ל

  • חיפוש מוצרים ויזואלי

    מאפשר לחפש תמונות של מוצרים לפי תיאור טקסטואלי באנגלית או בסינית, ולהפך.

  • סיווג מסמכים משולבי תמונה

    מייצר וקטור מייצג לדפי מסמך שלמים בלי לחתוך אותם, הודות להקשר של 32,768 טוקנים.

  • דירוג מחדש בסינית

    מציג ביצועים גבוהים במיוחד במיון ודירוג תוצאות חיפוש בסינית במאגרי מידע שונים.

איפה זה נופל

החולשה המרכזית שלו היא היעדר תמיכה בשפות שאינן אנגלית וסינית. אם תנסו להזין לו עברית, תקבלו תוצאות חלשות ולא עקביות כי הוא לא אומן עליה. בנוסף, משימות אחזור מורכבות בנושאים טכניים ומתמטיים הניבו ציונים נמוכים במבחנים, כך שהוא לא תמיד ימצא את המסמך הנכון בחיפוש טכני קשה.

אותה משפחה

gme-Qwen2-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לחיפוש טקסט בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא לא עבר אופטימיזציה לעברית, ולכן לא הייתי משתמש בו לחיפוש מסמכים בעברית במוצר אמיתי בלי אימון מקדים.

איזה כרטיס מסך נדרש כדי להריץ אותו מקומית?

קבצי המודל שוקלים 8.2 גיגה בייט בדיוק מלא. כדי להריץ אותו בנוחות עם קלטים ארוכים ותמונות, תצטרכו כרטיס מסך עם 12 עד 16 גיגה זיכרון וידאו לפחות.

במה הוא שונה ממודל הטמעה רגיל כמו bge או e5?

רוב מודלי ההטמעה יודעים לקרוא רק טקסט נקי. המודל הזה בנוי על ארכיטקטורת ראייה ויודע לקבל תמונה ישירות וליצור ממנה וקטור באותו מרחב של הטקסט.

איך מריצים

המשקל הכולל של הקבצים עומד על 8.2 גיגה בייט בדיוק float32, כך שנדרש כרטיס מסך עם לפחות 10 עד 12 גיגה זיכרון כדי להחזיק אותו בזיכרון ולהריץ הטמעות בצורה יציבה. הרצה על גבי מעבד רגיל תהיה איטית מדי לכל תרחיש של זמן אמת, בעיקר כשמשלבים עיבוד תמונה. הטעינה נעשית בצורה ישירה דרך ספריית sentence-transformers או קוד transformers רגיל.

אם יש לכם שרת עם כרטיס תואם פנוי, ההרצה העצמית פשוטה ולא מצריכה תשתית מסובכת. אם מדובר בשימוש מזדמן או שאין גישה לחומרה ייעודית, עדיף להשתמש בנקודת קצה מנוהלת בענן שגובה לפי קריאה, במקום לשלם על שרת ייעודי שפועל בלי הפסקה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Alibaba-NLP/gme-Qwen2-VL-2B-Instruct")
v = m.encode(["שלום עולם"])

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש בתוך מוצרים סגורים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי תשלום תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗