GPT
J

jina-vlm

קוד פתוח

jinaaicc-by-nc-4.02025-11-17

  • transformers
  • safetensors
  • jvlm
  • text-generation
  • multimodal

יש כאן גם סקירה על Jina AI עצמו.

מודל ראייה ושפה קטן של 2.5 מיליארד פרמטרים שמתמחה בריבוי שפות ודוחס תמונות ברזולוציה חופשית ברבע מכמות הטוקנים הרגילה. מתאים למי שרוצה ניתוח תמונות חסכוני בלי משקולת של מודל ענק.

  • 2.5Bפרמטרים
  • 9.3 GBמשקל הקבצים
  • 757הורדות בחודש
  • 124לייקים

מה זה

הארכיטקטורה מחברת בין מקודד התמונה SigLIP2 לבין מודל השפה Qwen3 בגרסת 1.7B. הרעיון המרכזי כאן הוא חלוקת תמונות למקטעים עם מנגנון איגום מבוסס תשומת לב, מה שמאפשר לו לקצץ פי ארבעה במספר הטוקנים הוויזואליים שנשלחים למודל השפה בלי לאבד את המבנה המרחבי של התמונה.

במבחני ביצועים מול דגמים מקבילים בקטגוריית ה־2B, כמו Qwen3-VL ו־InternVL3.5, הוא מציג יתרון עקבי. במבחן השאלות הרב-לשוני MMMB הוא מגיע ל־78.8 לעומת 75.0 של Qwen3-VL, ובמבחן RealWorld QA הוא משיג 68.2 נקודות. בפועל זה אומר שהוא מזהה פרטים בעולם האמיתי ומבין שאלות בשפות שאינן אנגלית טוב יותר מרוב המתחרים הישירים בגודל שלו.

מתאים ל

  • ניתוח תמונות באפליקציות קצה

    מודל קל משקל שרץ על חומרה מקומית צנועה ויודע לזהות אובייקטים וסיטואציות בתמונות.

  • מענה לשאלות בערבית ואנגלית

    המודל מוביל במבחני VQA רב-לשוניים ומתאים למחקר או פרויקטים המשלבים ערבית ושפות אירופיות.

  • השוואה וניתוח של כמה תמונות

    תמיכה מובנית בקבלת מספר תמונות במקביל יחד עם צריכת טוקנים נמוכה פי ארבעה מהרגיל.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא רשימת השפות הנתמכות. המודל הוכשר על אנגלית, סינית, ערבית, פורטוגזית, רוסית, טורקית, גרמנית וספרדית בלבד, ועברית אינה ברשימה הרשמית. ניסיון לשאול שאלות בעברית עלול להניב הזיות או תשובות שבורות, אלא אם מתרגמים קודם את הפרומפט לאנגלית או לערבית. בנוסף, חלוקת התמונה לעד 12 מקטעים אמנם חוסכת זיכרון, אך היא עדיין עשויה להחמיץ טקסט זעיר במסמכים צפופים מאוד.

שאלות
נפוצות

האם המודל מבין ומייצר עברית?

עברית אינה מופיעה ברשימת השפות שנתמכות רשמית בכרטיס המודל. מודל השפה שבבסיסו עשוי לפלוט מעט עברית מקרית, אבל התוצאות לא יהיו אמינות, ולכן מומלץ לעבוד איתו באנגלית או בשפות הנתמכות כמו ערבית ורוסית.

האם אפשר להשתמש במודל הזה במוצר מסחרי?

לא. הרישיון הוא לא-מסחרי לחלוטין. אם אתם בונים שירות בתשלום או כלי עסקי, תצטרכו לפנות לחברה כדי להסדיר רישוי מתאים או לבחור מודל פתוח בעל רישיון מתירני כמו אפאצ'י או MIT.

איך מריצים

המשקל הכולל של הקבצים עומד על 9.3 גיגה-בייט, כך שכרטיס מסך בודד עם 8 עד 12 גיגה-בייט זיכרון יריץ אותו בלי בעיה ב־bfloat16 או float16. המודל נתמך ישירות בספריית transformers וגם דרך vLLM לצורך הרצה מהירה, כולל תמיכה ב־FlashAttention2 שמומלץ להפעיל כדי לייעל את המעבר על מקטעי התמונה.

אם אין לכם כרטיס מסך פנוי או שמדובר בניסוי נקודתי, יש גישה דרך ממשק תואם OpenAI בשרתי החברה. עם זאת, בשימוש ב־API יש לקחת בחשבון השהיית הפעלה קרה של כ־30 עד 60 שניות כשהשירות עולה מאפס, כך שלמערכות בזמן אמת עדיף להחזיק שרת ייעודי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="jinaai/jina-vlm")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון cc-by-nc-4.0. המשמעות ברורה וחדה, אסור להשתמש בו לכל מטרה מסחרית, מוצר שנמכר ללקוחות או פיצ'ר שמייצר הכנסה ישירה או עקיפה. מותר להשתמש בו רק למחקר, פרויקטים אישיים, הדגמות פנימיות וניסויים שאינם למטרות רווח.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗