GPT
J

jasper_en_vision_language_v1

קוד פתוח

NovaSearchרישיון לא דווח2024-12-11

  • sentence-transformers
  • safetensors
  • jasper_vl
  • mteb
  • custom_code

מודל וקטורי שמשלב ראייה ושפה עם חלון הקשר חריג של 131,072 טוקנים. הוא פונה למי שמחפש שליפה ודירוג טקסט באנגלית ומסוגל להחזיק מסמכי ענק בלי לחתוך אותם.

  • 2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 3.7 GBמשקל הקבצים
  • 42,226הורדות בחודש

מה זה

מדובר במודל הטמעות וקטוריות בארכיטקטורת JasperVL שרץ דרך sentence-transformers ומכיל שני מיליארד פרמטרים. לפי השם והארכיטקטורה הוא כולל רכיב חזותי לצד הטקסט, אך עיקר הנתונים שפורסמו עבורו מתמקדים בביצועי טקסט טהורים באנגלית.

במבחני MTEB הוא רושם ציונים גבוהים בסיווג, כולל דיוק של 97.58% ב־AmazonPolarity ו־95.72% ב־AmazonCounterfactual. מצד שני, במשימות מורכבות יותר של הבנת סנטימנט רב-דרגתי כמו AmazonReviews הדיוק צונח ל־62.91%, מה שמעיד על קושי בהבחנה בין דרגות ביניים של ביקורת.

במשימות אחזור ודירוג מחדש הוא מציג יכולת יציבה. בבדיקות ArguAna הוא מגיע ל־Recall@10 של 91.11% עם מדד NDCG@10 של 65.2, ובמאגר השאלות של אנדרואיד הוא מגיע ל־MRR ראשוני של 46.78%. השילוב של ביצועי אחזור סבירים עם חלון עבודה עצום הופך אותו למועמד למערכות שמטפלות בטקסטים שלמים ולא בפסקאות בודדות.

מתאים ל

  • אחזור מסמכים ארוכים באנגלית

    חלון של 131 אלף טוקנים מאפשר להטמיע מאמרים ודוחות מלאים לחיפוש סמנטי בלי לחלק אותם לחלקים קטנים.

  • סינון שאלות כפולות בפורומים

    המודל מציג ציון מפת דירוג של 67.38 ו־MRR של 79 במאגרי שאלות, מה שמתאים לזיהוי חזרות טכניות.

  • סיווג פניות תמיכה באנגלית

    דיוק של 87.22% ב־Banking77 מראה שהוא מסוגל להבדיל היטב בין כוונות משתמש שונות במערכות שירות.

איפה זה נופל

הבעיה הבולטת ביותר היא השפה. המודל הוגדר ותועד באנגלית בלבד, ואין שום תיעוד לתמיכה בעברית, כך שבפרויקטים מקומיים הוא צפוי להיכשל. בנוסף, אף שהארכיטקטורה מוגדרת כחזותית, כרטיס המודל לא חושף אף מבחן ביצועים שקשור לתמונות, ולכן היכולת המולטימודלית שלו אינה מוכחת במספרים.

שאלות
נפוצות

האם המודל יצליח לחפש מסמכים בעברית?

לא. המודל מוגדר רשמית לאנגלית בלבד וכל המבחנים שלו נערכו בשפה זו. הרצה של טקסטים בעברית תניב ככל הנראה הטמעות באיכות ירודה שלא יתאימו לחיפוש סמנטי תקין.

איך אפשר לבדוק את יכולות הראייה של המודל?

כרטיס המודל לא כולל נתונים או דוגמאות על ביצועי הראייה שלו. הדרך היחידה היא לטעון אותו ידנית דרך הספרייה המתאימה ולהריץ מבחן עצמאי מול קובצי תמונה.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.7 גיגה-בייט בדיוק bfloat16, כך שכרטיס מסך פשוט עם 8 גיגה זיכרון יספיק כדי לטעון ולהריץ אותו מקומית. הטעינה נעשית ישירות דרך ספריית sentence-transformers הרגילה בפייתון, בלי תלויות מורכבות.

אם אתם צריכים לאנדקס כמויות קטנות של מסמכים ארוכים, שרת מקומי עם מעבד גרפי בסיסי יעשה את העבודה בזול. אם המטרה היא להטמיע מיליוני פריטים בזמן אמת, תחזוקת תשתית כזו תדרוש משאבים כבדים ועדיף לפנות ל־API מנוהל שמחייב לפי קריאות.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("NovaSearch/jasper_en_vision_language_v1")
v = m.encode(["שלום עולם"])

הרישיון

היוצרים לא דיווחו על רישיון שימוש בקבצי המודל. במצב כזה ברירת המחדל המשפטית היא שליוצרים שמורות כל הזכויות, ואסור לשלב אותו בקוד מסחרי או להפיץ אותו במוצר בלי לקבל אישור כתוב ומפורש מ־NovaSearch.

הרישיון המלא בעמוד המודל ↗