GPT
O

OmniVLM-968M

קוד פתוח

NexaAIapache-2.02024-11-14

  • gguf
  • multimodal
  • conversational
  • GGUF
  • Image-Text-to-Text

מודל ראייה ושפה קטן של 968 מיליון פרמטרים שרץ ישירות על מכשירי קצה. הוא דוחס תמונות ל־81 תוקנים בלבד ומייצר תיאורים או עונה על שאלות במהירות גבוהה.

  • 6.3 GBמשקל הקבצים
  • 1,053הורדות בחודש
  • 531לייקים

מה זה

הבסיס כאן משלב את SigLIP בנפח 400 מיליון פרמטרים לעיבוד התמונה עם מודל השפה Qwen2.5 בנפח חצי מיליארד פרמטרים. במקום לשלוח מאות תוקנים של תמונה למודל השפה כמו שמקובל בארכיטקטורת LLaVA, שכבת הקישור דוחסת את הייצוג הוויזואלי מ־729 ל־81 תוקנים בלבד. החיתוך הזה מוריד משמעותית את זמן החישוב ואת צריכת הזיכרון בעת יצירת הטקסט.

במבחני ביצועים מול nanoLLAVA הוא מציג יתרון עקבי בכל המדדים שנבדקו. במבחן POPE שבודק הזיות של פרטים בתמונה הוא קיבל 93.3 בגרסה השנייה שלו, ובמדד ChartQA לקריאת גרפים הוא עומד על 61.9 נקודות. עם זאת, בבדיקות מורכבות יותר של הבנה כללית כמו MMMU התוצאה נעצרת באזור ה־42 נקודות, כך שלא מדובר בתחליף למודלי ענק אלא בכלי ממוקד למשימות מוגדרות.

מתאים ל

  • תיאור תמונות במכשיר קצה

    הפקת תיאור קצר לתמונות במהירות ובפחות מגיגה זיכרון, בלי להוציא מידע לרשת.

  • מענה על שאלות מתרשימים

    חילוץ נתונים מגרפים פשוטים ומענה לשאלות מוגדרות על בסיס ציון של 61.9 ב־ChartQA.

  • זיהוי ויזואלי בסיסי לרובוטיקה

    זיהוי עצמים ופרטים בסיסיים בתמונה עם מעט הזיות בזכות כיוונון DPO וצריכת משאבים מינימלית.

איפה זה נופל

היוצרים מציינים במפורש שהמודל נמצא בשלבי פיתוח מוקדמים ושקיימת חולשה מהותית בהבנת מסמכים וטקסט מתוך תמונות. ציון של 30.9 במבחן MM-VET מראה בבירור ששאלות ויזואליות שדורשות היגיון רב־שלבי עדיין מכשילות אותו בקלות.

מעבר לכך, מודל השפה הפנימי קטן מאוד, חצי מיליארד פרמטרים בלבד, מה שמגביל את עומק התשובות, את רמת הדיוק בניסוח, ואת היכולת להתמודד עם הנחיות מורכבות בלי לסטות מהנושא.

שאלות
נפוצות

האם המודל מתאים לחילוץ טקסט מתמונות ומסמכים סרוקים?

לא. מפתחי המודל מציינים בפירוש שהבנת מסמכים וטקסט היא מגבלה נוכחית שנמצאת עדיין בעבודה. אם המטרה העיקרית היא OCR או קריאת קבלות, עדיף לבחור כלי ייעודי אחר.

כמה זיכרון חומרה צריך כדי להריץ אותו מקומית?

המודל מתוכנן לעבוד במגבלות זיכרון נמוכות מאוד. בבדיקות שפורסמו הוא דרש 988 מגה־בייט בלבד של זיכרון עבודה ונפח אחסון של פחות מגיגה, כך שהוא רץ בקלות על לפטופ סטנדרטי.

איך מריצים

כדי להריץ אותו מקומית מורידים את Nexa-SDK, חבילת קוד פתוח להתקנה פשוטה, ומריצים פקודה בודדת של הרצה בטרמינל. יש גם קובצי GGUF שמתאימים למערכות מבוססות llama.cpp, כשהדגמות החברה מציגות עיבוד תמונה בפחות משתי שניות וצריכה של פחות מגיגה זיכרון עבודה על מחשב מקבוק.

הדרישות החומרתיות צנועות מאוד ומתאימות למחשבים אישיים בלי כרטיסי מסך כבדים. אם אתם צריכים רק לנתח מדי פעם תמונות בודדות בענן או לקרוא מסמכים ארוכים עם טקסט צפוף, עדיף להשתמש ב־API חיצוני חזק יותר ולא להתעסק עם הרצה מקומית של מודל קטן.

ollama run hf.co/NexaAI/OmniVLM-968M:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗