GPT
M

MiniCPM4-8B

קוד פתוח

openbmbapache-2.02025-06-05

  • transformers
  • safetensors
  • minicpm
  • text-generation
  • conversational

מודל שפה בגודל 8.2 מיליארד פרמטרים, שנבנה במיוחד להרצה מהירה על מכשירי קצה ועיבוד טקסטים ארוכים ביעילות חישובית גבוהה.

  • 8.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 39,066הורדות בחודש

מה זה

המודל פותח על ידי openbmb ואומן על 8 טריליון טוקנים באנגלית ובסינית. המיקוד המרכזי כאן אינו סתם עוד מודל גנרי אלא יעילות ביצועים, בייחוד דרך מנגנון קשב דליל בשם InfLLM v2. המנגנון הזה מחשב קשרים רק מול פחות מ־5% מהטוקנים ברצפים ארוכים, מה שחוסך משאבי זיכרון וחישוב שמעמיסים בדרך כלל על מודלים בגודל כזה.

המפתחים מציגים נתוני מהירות שמראים יתרון ניכר על פני חלופות באותו סדר גודל. על גבי מעבד Jetson AGX Orin, המודל מציג מהירות פענוח גבוהה פי 7 בהשוואה ל־Qwen3-8B. חלון ההקשר הטבעי עומד על 32,768 טוקנים, כאשר החוקרים מדווחים על יכולת הרחבה עד 131,072 טוקנים באמצעות מנגנון LongRoPE ומבחני שליפה מוצלחים באורך 128K.

מתאים ל

  • עיבוד מסמכים ארוכים באנגלית

    מנגנון הקשב הדליל מנתח טקסטים עד 128K טוקנים במהירות גבוהה ובמינימום משאבי חישוב.

  • הרצה על חומרת קצה

    התאמה למעבדים כמו Jetson AGX Orin מאפשרת עיבוד מקומי ללא תלות בשרתים מרוחקים.

  • הפעלת כלים ואינטגרציות

    האימון כולל נתוני קריאה לכלים ומערכות מבוססות MCP לעבודה אוטונומית.

איפה זה נופל

המודל אומן והוגדר רשמית רק עבור סינית ואנגלית, כך שאין שום הבטחה או בדיקה לגבי תפקודו בעברית. בנוסף, מנגנון הקשב הדליל מחייב תלויות ייעודיות וקוד חיצוני מקומפל, מה שעלול לייצר חיכוך בסביבות פיתוח סטנדרטיות. היוצרים מציינים במפורש שהפלט עלול לכלול תוכן שגוי ודורש אימות עצמאי, ללא הבנה או שיפוט אמיתי מצד המודל.

אותה משפחה

MiniCPM4 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל הוכרז וסומן עבור שפות אנגלית וסינית בלבד. הוא לא עבר אופטימיזציה ייעודית לעברית, ולכן לא מומלץ להסתמך עליו למשימות בשפה זו ללא בדיקה יסודית או אימון המשך.

האם חייבים לקמפל ספריות מיוחדות כדי להריץ אותו?

לא חובה, אפשר להריץ אותו דרך ספריית transformers הרגילה או דרך vLLM. עם זאת, כדי ליהנות מהאצת הקשב הדליל ברצפים ארוכים תצטרכו להתקין את ספריית infllmv2_cuda_impl או את CPM.cu.

איך מריצים

במשקל של כ־15.3 גיגה־בייט בדיוק bfloat16, תצטרכו כרטיס מסך בעל 24 גיגה־בייט זיכרון כמו RTX 4090 כדי להריץ אותו בנוחות יחד עם context מלא, או פלטפורמת קצה תואמת דוגמת Jetson AGX Orin.

אפשר להריץ אותו דרך vLLM או SGLang, אך מי שרוצה לסחוט את יתרונות הקשב הדליל יצטרך לקמפל את ספריית infllmv2_cuda_impl או להשתמש במנוע ה־CUDA הייעודי CPM.cu. אם אתם לא מחזיקים בחומרה מתאימה מקומית, ההתקנה של הספריות הייעודיות עשויה להיות מסורבלת ועדיף להשתמש במודל מרוחק דרך API.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/MiniCPM4-8B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי והפצה של המשקולות והקוד, ללא תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שאתם מפיצים במוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗