GPT
M

MiniCPM-V-4_5

קוד פתוח

openbmbapache-2.02025-08-24

  • transformers
  • safetensors
  • minicpmv
  • feature-extraction
  • minicpm-v

מודל רב מודלי של 8.7 מיליארד פרמטרים שדוחס וידאו ותמונות כדי לרוץ מקומית. הוא מתאים למי שרוצה ניתוח מסמכים ווידאו בלי לשלם עלויות ענן של מודלי ענק.

  • 8.7Bפרמטרים
  • 40,960טוקנים בהקשר
  • 16.2 GBמשקל הקבצים
  • 264,825הורדות בחודש

מה זה

במקום להזין מודל שפה במאות טוקנים לכל פריים, נעשה פה שימוש במנגנון דחיסה שמצמצם שש תמונות וידאו עוקבות לשישים וארבעה טוקנים בלבד. הדחיסה הזו מאפשרת לו לנתח וידאו בקצב של עד עשרה פריימים בשנייה בלי לחנוק את חלון ההקשר, שמגיע לארבעים אלף טוקנים. הבסיס שלו משלב בין מודל השפה Qwen3 לבין רכיב הראייה SigLIP2, והוא כולל תמיכה במצב חשיבה מהיר מול מצב מעמיק לפי בחירה.

במדד Video-MME על שמונה מאיצי A100, הוא סיים את ההסקה תוך רבע שעה בערך לעומת כמעט שלוש שעות במודלים אחרים בקטגוריה, תוך צריכה של 28 גיגה זיכרון גרפי. הוא מזהה טקסט בתמונות ברזולוציה של עד 1.8 מיליון פיקסלים, ומיועד במיוחד לקריאת מסמכים וקבצי PDF בלי להסתמך על מנועי פענוח חיצוניים.

מתאים ל

  • עיבוד וידאו עתיר פריימים

    דחיסת שישה פריימים לשישים וארבעה טוקנים מאפשרת סריקת צילומים ארוכים בניצול זיכרון נמוך יחסית.

  • חילוץ נתונים מקבצי PDF

    מבנה הראייה מתמודד עם מסמכים ברזולוציה גבוהה וממיר דוחות וטבלאות לטקסט מדויק ללא כלים נלווים.

  • הסקה מקומית על מכשירי קצה

    התמיכה בפורמט GGUF מאפשרת להפעיל את יכולות הראייה ישירות על לפטופים ומכשירים ניידים.

איפה זה נופל

למרות ההבטחות ליכולות רב לשוניות בלמעלה משלושים שפות, הדגשים והבדיקות המוצגים מתרכזים בעיקר באנגלית ובסינית. איכות הפענוח והתשובות בעברית, במיוחד בזיהוי כתב יד או מסמכים סרוקים מורכבים, אינה מובטחת ודורשת בדיקה מעשית מראש.

בנוסף, דחיסת הווידאו האגרסיבית חוסכת משאבים אבל עשויה לפספס פרטים קטנים או חולפים שמופיעים לשבריר שנייה. היוצרים מצהירים בפירוש שהמודל אינו בעל יכולת שיפוט ערכית, ועשוי לייצר הזיות בהקשרים מורכבים.

אותה משפחה

MiniCPM-V-4-5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי?

כן, אבל רק עם כיול והקטנת דיוק. המשקלים המקוריים שוקלים מעל 16 גיגה ודורשים כרטיס עם 24 גיגה זיכרון, אך גרסאות GGUF מכווצות ירוצו גם על כרטיסים צנועים יותר או ישירות על המעבד דרך llama.cpp.

מה זה מצב חשיבה מהיר מול עמוק ואיך שולטים בו?

בקריאה למודל אפשר להעביר פרמטר שמפעיל את מצב החשיבה המעמיק עבור בעיות מורכבות, או להשאיר אותו כבוי למענה מהיר וחסכוני יותר במשאבים במשימות יומיומיות.

איך מריצים

כדי להריץ אותו במשקל המקורי צריך כרטיס מסך עם לפחות 24 גיגה זיכרון, כמו RTX 3090 או כרטיס שרת, מכיוון שקבצי המשקלים תופסים מעל 16 גיגה לפני חישובי קשב. מי שמחפש הרצה על מחשב אישי או נייד יכול להשתמש בגרסאות מכווצות בפורמטים כמו GGUF או AWQ דרך llama.cpp או Ollama.

בשרתי ייצור אפשר לפרוס אותו באמצעות vLLM או SGLang. אם השימוש שלכם דורש רק שאילתות בודדות ביום ולא מצדיק החזקת שרת ייעודי שפועל רצוף, פנייה לשירותי ענן מסחריים תהיה זולה ופשוטה יותר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="openbmb/MiniCPM-V-4_5")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר ברישיון Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאים מחייבים שמירה על הודעת זכויות היוצרים והרישיון המקורי, והיוצרים מסירים כל אחריות לנזקים או בעיות אבטחה שייגרמו משימוש במודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗