GPT
M

MiniCPM-V-4.6

קוד פתוח

openbmbapache-2.02026-04-13

  • transformers
  • safetensors
  • minicpmv4_6
  • image-text-to-text
  • minicpm-v

מודל ראייה ושפה קומפקטי שמיועד לפעול ישירות על מכשירי קצה וטלפונים. הוא מציע יכולת ניתוח תמונות ווידאו בלי לדרוש שרת ייעודי כבד.

  • 1.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 530,314הורדות בחודש

מה זה

בבסיס שלו נמצא שילוב בין מקודד הראייה SigLIP2-400M למודל השפה Qwen3.5-0.8B, שמסתכמים יחד לכדי 1.3 מיליארד פרמטרים בלבד. הוא מתמודד עם תמונה בודדת, רצף תמונות וסרטוני וידאו, תוך שימוש במנגנון דחיסת טוקנים חזותיים של פי 4 או פי 16 כדי לחסוך חישובים כשצריך מהירות.

במדד Artificial Analysis Intelligence הוא השיג תוצאה 13, שעוקפת את מודל הבסיס של Qwen ואת מודל ה־3B של Ministral, בעלות טוקנים נמוכה משמעותית. הוא גם מתקרב לביצועים של מודלים בגודל 2B במבחני זיהוי טקסט ותמונות כמו OCRBench ו־OpenCompass, בזכות צמצום של מעל 50% בחישובי הקידוד החזותי שמבוסס על טכניקת LLaVA-UHD v4.

מתאים ל

  • זיהוי וניתוח וידאו במובייל

    משקל של 2.4 גיגה-בייט והתאמה מלאה למערכות אנדרואיד ו־iOS מאפשרים הרצה מקומית על טלפון בלי תלות בחיבור לרשת.

  • חילוץ טקסט מתמונות בקצה

    מציג תוצאות דומות למודלים כפולים מגודלו במבחני OCRBench, ומתאים למשימות קריאת מסמכים על מכשירים צנועים.

  • הפעלת פונקציות משולבת ראייה

    תומך בקריאה לכלים ומענה על שאלות מתמונה באמצעות שילוב מובנה ב־vLLM או שרת מקומי תואם OpenAI.

איפה זה נופל

הפלט עלול לפלוט תווים כמו ירידת שורה כמחרוזת גולמית במקום שבירת שורה אמיתית, מה שמחייב עיבוד טקסט ייעודי ברמת הקוד כדי לא לשבור תצוגה. בהפעלת פונקציות וקריאות לכלי חיצוני, התשובה מחזירה תגיות ייעודיות שאינן מפורקות אוטומטית על ידי transformers, ומחייבות חילוץ ידני באמצעות ביטויים רגולריים. מעבר לכך, מדובר במודל שפה של 0.8B בלבד, כך שלא צריך לבנות עליו להסברים מורכבים במיוחד.

אותה משפחה

MiniCPM-V-4.6 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מסוגל לעבד סרטוני וידאו ארוכים בלי לקרוס מחוסר זיכרון?

כן. ברירת המחדל מנהלת את קצב הפריימים באופן דינמי, כאשר סרטונים מעבר ל־128 שניות נדגמים בצורה אחידה על פני ציר הזמן. אפשר לשלוט על מספר הפריימים המרבי ולדחוס טוקנים פי 16 כדי לשמור על צריכת זיכרון יציבה.

האם צריך להכין סקריפטים מיוחדים כדי לנקות את התשובות שלו?

כן, בשני מקרים ספציפיים. אם משתמשים בקריאות לכלים חיצוניים צריך לחלץ את בלוק התגית ידנית עם regex, ובנוסף מומלץ להריץ פונקציית ניקוי כדי להמיר מחרוזות שבירת שורה מילוליות לירידות שורה אמיתיות.

איך מריצים

המשקל הכולל יושב על 2.4 גיגה-בייט, כך שהוא נכנס בקלות לזיכרון של כרטיסי מסך ביתיים צנועים ורץ גם ישירות על מכשירי אנדרואיד, iOS ומערכות הרמוני. אפשר לטעון אותו דרך transformers, להרים שרת מקומי ב־vLLM או SGLang, או להשתמש בגרסאות מכווצות בפורמטי GGUF דרך llama.cpp ו־Ollama.

יש לשים לב לתלויות של עיבוד הווידאו, שכן הספרייה torchcodec עלולה להתנגש עם סביבות שונות של CUDA. הפתרון הישיר והפשוט לפי התיעוד הוא החלפתה ב־PyAV. בנוסף, קיימת גרסת שירות מרוחקת שמאפשרת קריאה מהירה דרך מפתח ציבורי חינמי למי שלא רוצה להחזיק תשתית בכלל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="openbmb/MiniCPM-V-4.6")
print(pipe("שלום"))

הרישיון

הקוד ומשקלי המודל משוחררים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי והפצה, כל עוד שומרים על הודעות זכויות היוצרים והתנאים המקוריים של הרישיון בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗