GPT
M

MiniCPM-o-2_6

קוד פתוח

openbmbapache-2.02025-01-12

  • transformers
  • safetensors
  • minicpmo
  • feature-extraction
  • minicpm-o

מודל פתוח של 8.7 מיליארד פרמטרים שמחבר ראייה, קול וטקסט בשידור חי. הוא מתאים למי שרוצה שיחה קולית רציפה ועיבוד וידאו מקומי בלי להישען על שירותי ענן סגורים.

  • 8.7Bפרמטרים
  • 32,768טוקנים בהקשר
  • 16.2 GBמשקל הקבצים
  • 259,050הורדות בחודש

מה זה

הארכיטקטורה מחברת ישירות בין כמה רכיבים קיימים, ומעבדת תמונה, אודיו וטקסט מקצה לקצה בלי שרשור מודלים חיצוניים. החידוש העיקרי כאן הוא מנגנון חלוקת זמן שמאפשר לו לקבל רצף וידאו ושמע במקביל ובזמן אמת, ולהגיב בקול תוך כדי תנועה.

במבחני ביצועים הוא עומד יפה מול מתחרים גדולים בהרבה. במדד OpenCompass לתמונות הוא הגיע לתוצאה של 70.2, ובכך עוקף מערכות כמו קלוד 3.5 סונט וג'מיני 1.5 פרו. דחיסת התמונה שלו יעילה במיוחד, וממירה תמונה של 1.8 מיליון פיקסלים ל־640 טוקנים בלבד, נתון שמוריד משמעותית את זמן ההמתנה לתשובה הראשונה.

מתאים ל

  • עוזר קולי לשידור חי

    קבלת זרם וידאו ושמע ברצף ומענה קולי מהיר באנגלית או סינית בלי תלות ברשת חיצונית.

  • פענוח מסמכים ותמונות

    ניתוח מסמכים עתירי טקסט עם ציון 897 במדד OCRBench ודחיסה גבוהה של פיקסלים לטוקנים.

  • הטמעה במכשירים מקומיים

    הרצה יעילה במערכות קצה בעזרת גרסאות מקוונטטות של int4 וקבצי GGUF דרך ספריית llama.cpp.

איפה זה נופל

התמיכה בשיחה קולית מוגבלת לשפות אנגלית וסינית בלבד. למרות הצהרה על יכולות רב־לשוניות בלמעלה מ־30 שפות, כרטיס המודל לא מציג נתונים לגבי עברית, כך שלא כדאי לבנות עליו לעיבוד קולי או טקסטואלי מקומי בלי בדיקה מקיפה. בנוסף, חלק מציוני הבנצ'מרק הגבוהים הושגו רק באמצעות שימוש בהנחיות שרשרת חשיבה, תהליך שמייקר את זמן הריצה ולא תמיד ישים בתקשורת חיה.

אותה משפחה

MiniCPM-o-2-6 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בשיחה קולית בעברית?

הכרטיס מציין שיחה קולית דו־לשונית באנגלית ובסינית בלבד. יכולות רב־לשוניות מוזכרות לטקסט בלמעלה מ־30 שפות, אך אין שום פירוט על איכות השמע או הטקסט בעברית.

האם חייבים כרטיס גרפי חזק כדי להפעיל אותו?

לא חובה למשימות בסיסיות. מעבר למשקל המלא של 16.2 גיגה־בייט, יש גרסאות מוקטנות בפורמט GGUF ו־int4 שמאפשרות הרצה דרך מעבד רגיל ב־llama.cpp על מכשירים ניידים.

מה היתרון שלו בעיבוד תמונות בהשוואה למודלים אחרים?

הוא מייצר 640 טוקנים בלבד עבור תמונה ברזולוציה של 1.8 מיליון פיקסלים. הדחיסה הזו חוסכת כ־75 אחוזים מכמות הטוקנים המקובלת, מה שמאיץ את התגובה וחוסך זיכרון.

איך מריצים

המשקל המלא עומד על 16.2 גיגה־בייט בפורמט bfloat16, מה שדורש כרטיס גרפי ייעודי עם מספיק זיכרון וידאו כדי להחזיק את המודל וחלון הקשר של עד 32,768 טוקנים. למי שרוצה להריץ על חומרה מקומית צנועה יותר כמו מעבדי מחשב אישי או טאבלטים, קיימות גרסאות מקוונטטות של int4 ו־GGUF, לצד תמיכה ב־llama.cpp וב־vLLM להאצת תעבורה.

אם אתם לא צריכים שמע דו־כיווני או תגובה בזמן אמת לזרם וידאו, שווה לשקול פנייה ל־API מסחרי. החזקת תשתית מקומית לרוחב פס של מולטימדיה רציפה כבדה מאוד לתחזוקה שוטפת.

from transformers import pipeline

pipe = pipeline("any-to-any", model="openbmb/MiniCPM-o-2_6")
print(pipe("שלום"))

הקבצים

40 קבצים במאגר, 16.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. התנאים המרכזיים דורשים שמירה על הקרדיט המקורי והודעת הרישיון, בלי לקחת אחריות משפטית על ביצועי המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗