GPT
M

MiniCPM-V-4

קוד פתוח

openbmbapache-2.02025-07-12

  • transformers
  • safetensors
  • minicpmv
  • feature-extraction
  • minicpm-v

מודל ראייה ושפה קומפקטי שמכוון להרצה ישירות על מכשירי קצה. הוא מציע ביצועים חזקים בניתוח תמונות ווידאו כמעט בלי לתפוס משאבים.

  • 4.1Bפרמטרים
  • 32,768טוקנים בהקשר
  • 7.6 GBמשקל הקבצים
  • 96,330הורדות בחודש

מה זה

הארכיטקטורה מחברת בין SigLIP2-400M לעיבוד תמונה לבין MiniCPM4-3B כבסיס הטקסטואלי, בסך הכל 4.1 מיליארד פרמטרים. המטרה כאן ברורה, לתת מענה לעיבוד תמונה בודדת, רצף תמונות וקטעי וידאו בגודל קובץ של 7.6 גיגה בייט בלבד, כזה שנכנס בקלות לזיכרון של מחשב נייד או טלפון.

במבחני OpenCompass הוא מציג ציון ממוצע של 69.0, ועוקף מודלים גדולים ממנו כמו MiniCPM-V 2.6 שהחזיק 8.1 מיליארד פרמטרים, וגם את Qwen2.5-VL-3B. בבדיקות OCR ספציפיות כמו OCRBench הוא מגיע ל־894 נקודות, תוצאה גבוהה שמעידה על חדות בקריאת טקסט מתוך מסמכים ותרשימים ביחס לקטגוריית המשקל שלו.

מתאים ל

  • קריאת מסמכים מקומית

    חילוץ נתונים מדוחות וקבלות ישירות במכשיר הלקוח, בלי להוציא מידע רגיש לרשת.

  • ניתוח תמונות באפליקציות

    זיהוי פריטים וסריקת טקסט מתוך תמונות על גבי טלפונים ניידים בזמן אמת.

  • בדיקת רצפי וידאו קצרים

    מעקב אחר התרחשויות בקטעי וידאו קצרים על חומרה מקומית צנועה.

איפה זה נופל

למרות הציונים הגבוהים בראייה, במבחני מתמטיקה מורכבים עם תמונות כמו MathVision הוא נעצר על 20.7 נקודות, הרחק מאחורי מודלים מסחריים סגורים. גם בניתוח וידאו ללא כתוביות במבחן Video-MME הוא משיג 61.2 נקודות, שזה שיפור לקטגוריה אבל עדיין משאיר מקום לטעויות ברצפים ארוכים. המפתחים מדגישים שהמודל אינו מפעיל שיקול דעת או הבנה פנימית, ונוטה להזיות שדורשות בדיקה זהירה אם מייעדים אותו לחילוץ מידע קריטי.

אותה משפחה

MiniCPM-V-4 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל מוגדר כרב לשוני ומבוסס על שילוב של SigLIP2 ו־MiniCPM4. עם זאת, הדוגמאות והמבחנים הרשמיים מתמקדים בעיקר באנגלית ובסינית. מומלץ לבדוק את איכות הפלט והזיהוי של טקסט עברי לפני שמשלבים אותו בזרימת עבודה אמיתית.

האם הוא באמת יכול לרוץ על טלפון?

כן, המפתחים בנו אותו במיוחד לפריסה במכשירי קצה ואף שחררו קוד לאפליקציית iOS. במכשירים חזקים כמו iPhone מהדורות האחרונים הוא מייצר מעל 17 טוקנים לשנייה, אם כי עדיין מדובר בעומס משמעותי על הסוללה בעבודה רציפה.

איך מריצים

בזכות משקל של 7.6 גיגה בייט בדיוק bfloat16, אפשר להריץ אותו מקומית על כרטיסי מסך צרכניים עם 10 עד 12 גיגה בייט זיכרון, או לכווץ אותו לפורמט GGUF ולהריץ על מעבד או ישירות על טלפון נייד. המפתחים מציגים נתון של פחות משתי שניות לטוקן ראשון ומעל 17 טוקנים לשנייה על מעבד של iPhone 16 Pro Max, לצד אפליקציית iOS ייעודית.

הוא נתמך ישירות בכלים פופולריים כמו vLLM, SGLang, Ollama ו־llama.cpp. אם אתם צריכים לנתח אלפי שעות וידאו במקביל או שאתם לא רוצים לנהל שרתים וזיכרון, פנייה ל־API חיצוני תחסוך כאב ראש. אבל לשימוש מקומי, במיוחד במכשירים מנותקי רשת, אין סיבה לשלם לספק ענן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="openbmb/MiniCPM-V-4")
print(pipe("שלום"))

הרישיון

הקוד ומשקולות המודל שוחררו תחת רישיון Apache-2.0. הרישיון חופשי לחלוטין ומתיר שימוש מסחרי, שינוי של הקוד והפצה בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והפניה לרישיון. המפתחים מבקשים למלא שאלון קצר באתר שלהם, אך מדובר בבקשה אופציונלית שאינה מגבילה את השימוש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗