GPT
M

MiniCPM-o-4_5

קוד פתוח

openbmbapache-2.02026-02-03

  • transformers
  • onnx
  • safetensors
  • minicpmo
  • feature-extraction

מודל של 9.4 מיליארד פרמטרים שמחבר ראייה, שמע וטקסט בזמן אמת. הוא מתאים למי שרוצה אינטראקציה קולית מלאה תוך צפייה בווידאו בלי להסתמך על חיבור לשירותי ענן.

  • 9.4Bפרמטרים
  • 40,960טוקנים בהקשר
  • 18.7 GBמשקל הקבצים
  • 753,030הורדות בחודש

מה זה

במקום להדביק יחד מודל שמיעה, מודל שפה ומודל דיבור, כאן הכול מחובר מקצה לקצה. הבסיס נשען על SigLip2 לראייה, Whisper-medium לקלט שמע, CosyVoice2 לקול ו־Qwen3-8B כליבת השפה. המבנה הזה מקבל זרם וידאו ושמע במקביל ומייצר תגובות קוליות בלי לחסום את שאר הערוצים. הוא מציע גם שכפול קול מקובץ שמע קצר ומצב יזום שבו הוא מחליט בעצמו מתי לדבר בתדירות של הרץ אחד.

במבחני OpenCompass לתמונות הוא השיג ציון של 77.6 במצב Instruct, מעל GPT-4o וקרוב מאוד ל־Gemini 2.5 Flash שמגיע ל־78.5. בפיענוח מסמכים באנגלית על OmniDocBench הוא מציג שגיאות עריכה נמוכות יותר ממודלים ענקיים, מה שמראה שהכוח שלו הוא בדיוק ויזואלי של טקסטים, נוסחאות וטבלאות ברזולוציה של עד 1.8 מיליון פיקסלים, לצד וידאו של עד עשרה פריימים בשנייה.

מתאים ל

  • עוזר קולי שרואה מסך או מצלמה

    מאפשר שיחה טבעית באנגלית וניתוח וידאו בו זמנית בלי השהיות של שרשור כלים.

  • חילוץ מידע מדוחות וטבלאות

    מפענח מסמכים סרוקים, נוסחאות וקובצי PDF באנגלית בדיוק גבוה יותר מרוב המודלים הגדולים.

  • מערכת בדיקה שמתריעה עצמאית

    בוחן וידאו ברצף ויודע להעיר קולית כשהוא מזהה שינוי בלי שתצטרכו לשאול אותו שאלה.

איפה זה נופל

השיחה הקולית מוגבלת כרגע לאנגלית ולסינית בלבד, כך שאי אפשר להשתמש בערוץ השמע בעברית. בנוסף, למרות ביצועים טובים בווידאו, במבחני ראיית תנועה כמו MotionBench הוא מגיע ל־61.4, שזה פחות טוב מחלק מהמתחרים. המנגנון שיוזם דיבור עצמאי בודק את המצב בכל שנייה, מה שעלול לייצר תגובות לא קשורות או התפרצויות אם זרם הקלט רועש.

אותה משפחה

MiniCPM-o-4-5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בשיחה קולית בעברית?

לא. היכולת הקולית המלאה, כולל שכפול קול והזרמת שמע, עובדת רק באנגלית ובסינית. היכולות הרב לשוניות הרחבות יותר, שמכסות מעל 30 שפות, תקפות בעיקר לעיבוד טקסט.

מה ההבדל בין מצב Instruct למצב Thinking?

במצב Instruct המודל עונה מיד ומיועד לשיחה שוטפת ומהירה. מצב Thinking מפעיל תהליך חשיבה ארוך יותר לפני התשובה, מה שמשפר את הביצועים בשאלות מורכבות ובמבחני הבנה ויזואלית.

איך מריצים

בדיוק המלא של bfloat16 הקבצים שוקלים 18.7 גיגהבייט. כדי להריץ אותו דרך PyTorch תצטרכו כרטיס Nvidia עם 24 גיגהבייט זיכרון גרפי, כמו RTX 3090 או 4090, וגם שם הזיכרון יהיה גבולי ברגע שפותחים את חלון ההקשר של 40 אלף טוקנים. לעבודה בתפוקה גבוהה אפשר להרים אותו מעל vLLM או SGLang.

אם אין לכם חומרה כזו, קיימות גרסאות מכווצות ב־GGUF וב־int4 שמיועדות ל־llama.cpp ול־Ollama, ומאפשרות להריץ אותו מקומית על מחשבים כמו Mac. אם הפרויקט שלכם דורש שיהוי אפסי בהזרמת וידאו וקול מלאים ואין לכם שרת ייעודי חזק, הרצה עצמית של המודל המלא תהיה כבדה ועדיף לחכות לגישה דרך שירות ענן.

from transformers import pipeline

pipe = pipeline("any-to-any", model="openbmb/MiniCPM-o-4_5")
print(pipe("שלום"))

הקבצים

54 קבצים במאגר, 18.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים ולהפיץ אותם בתוך מוצר סגור או פתוח, כל עוד משאירים את הצהרת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗