GPT
N

North-Micro-Vision-Instruct

קוד פתוח

CohereLabsapache-2.02026-08-10

  • transformers
  • safetensors
  • cohere_compass
  • image-text-to-text
  • vision

מודל ראייה קומפקטי שמפענח תמונות ברזולוציה המקורית שלהן, במקום לכווץ ולמרוח פרטים קטנים. מתאים למי שצריך OCR איכותי, קריאת מסמכים ומיקום אובייקטים מקומית בלי לרוקן את הזיכרון של כרטיס המסך.

  • 2.5Bפרמטרים
  • 500,000טוקנים בהקשר
  • 4.6 GBמשקל הקבצים
  • 62,727הורדות בחודש

מה זה

המודל מחבר מפענח ראייה ייעודי של 400 מיליון פרמטרים עם מודל שפה של שני מיליארד פרמטרים. ההבדל המרכזי מול מתחרים באותו משקל הוא התמיכה ברזולוציה מקורית. במקום לחתוך תמונה לריבוע קבוע ולעוות אותה, הוא שומר על יחס הגובה-רוחב ומזריק ייצוגים ויזואליים מכמה שכבות עמוקות ישירות לשכבות המוקדמות של הטקסט.

במבחני ביצועים רואים את זה בעיקר במסמכים ובדיאגרמות. הוא קיבל 0.921 ב־DocVQA ו־0.808 ב־ChartQA, שזה גבוה מרוב המודלים בגודל שלו ואפילו מכמה גדולים ממנו כמו Phi-3.5-vision. הוא חזק במיוחד גם באיתור אובייקטים לפי טקסט, עם תוצאה של 0.732 ב־RefCOCO, שמחזירה נקודות ציון מנורמלות של תיחום על התמונה.

מצד שני, התוצאות בתחום החשיבה המדעית חלשות מאוד. ציון של 0.329 בלבד ב־MMMU מבהיר שלא מדובר בכלי שיבין נוסחאות או גרפים הנדסיים מורכבים. הוא מעבד מידע חזותי קיים, לא פותר בעיות לוגיות.

מתאים ל

  • חילוץ מידע מדוחות וחשבוניות

    מצטיין בהבנת מבנה של מסמכים, טבלאות וסריקות ברזולוציה גבוהה בלי עיוותי גופנים.

  • איתור ותיחום עצמים בתמונה

    מחזיר קואורדינטות מנורמלות לאובייקטים לפי בקשת טקסט, עם דיוק גבוה יחסית לגודלו.

  • מודל בסיס לכוונון עצמי

    משקל קל שמאפשר אימון מהיר על חומרה מקומית למשימות סיווג וראייה ייעודיות.

איפה זה נופל

זה לא תחליף לעוזר שיחה כללי. המודל חלש מאוד בקוד ובמתמטיקה, ואין לו יכולת להפעיל כלים, לקרוא לפונקציות או להריץ סוכנים אוטונומיים. הוא גם לא עבר אימון עם שורת מערכת, כך שהוספת System Prompt בתבנית עלולה לפגוע בביצועים.

מגבלה משמעותית נוספת היא ההקשר. המודל אומן מולטימדיאלית רק עד 8,000 טוקנים, ולכן הזנת עשרות תמונות או מסמכים ענקיים ברצף אחד תוביל לחוסר יציבות. בנוסף, עיבוד ברזולוציה מקורית מקפיץ את צריכת הזיכרון ואת זמני התגובה ככל שהתמונות גדולות יותר. לגבי עברית, היא לא מופיעה ברשימת השפות שנתמכות רשמית בכרטיס.

שאלות
נפוצות

האם המודל יודע לקרוא טקסט בעברית מתוך תמונה?

הכרטיס מפרט שפות כמו אנגלית, גרמנית, הינדי, יפנית וערבית, אך עברית אינה מצוינת ברשימה הרשמית. סביר להניח שרמת הפענוח של טקסט עברי תהיה נמוכה, וכדאי לבדוק אותו ישירות על מדגם נתונים לפני בניית תהליך עבודה.

האם אפשר להשתמש בו ישירות בתוך שרת vLLM מוכן?

עדיין לא. התמיכה הרשמית של vLLM הוגדרה ככזו שתגיע בקרוב, ובינתיים ההרצה מתבצעת דרך ספריית transformers בגרסה 5.16.0 ומעלה או דרך MLX על גבי חומרת אפל.

איך מריצים

בגלל משקל של 4.6 גיגה-בייט בדיוק bfloat16, אפשר להריץ אותו בנוחות על כרטיס מסך בודד עם 8 עד 12 גיגה זיכרון, כמו כרטיסים ביתיים מודרניים. משתמשי מק יכולים להריץ אותו מקומית דרך משקלי MLX ייעודיים שהקהילה פרסמה, ויש תמיכה מובנית ב־Axolotl ובמתכונים של NVIDIA לאימון נוסף.

ההרצה בקוד דורשת גרסה ספציפית של transformers, גרסה 5.16.0 ומעלה, או התקנה ישירות ממאגר הגיטהאב שלהם. תמיכה רשמית ב־vLLM עדיין לא שוחררה. אם אתם צריכים רק לחלץ טקסט פעם בשעה בלי לנהל תשתית, עדיף להשתמש ב־API מנוהל. אם אתם מעבדים אלפי מסמכים רגישים מקומית, ההרצה העצמית משתלמת לגמרי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="CohereLabs/North-Micro-Vision-Instruct")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולהטמיע אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והפניה לרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗