GPT
M

MiniCPM5-1B

קוד פתוח

openbmbapache-2.02026-05-21

  • transformers
  • safetensors
  • llama
  • text-generation
  • minicpm

מודל של 1.1 מיליארד פרמטרים שמיועד לרוץ מקומית על מחשבים פשוטים. הוא משלב הפעלת כלים, תמיכה בהקשר של 131,072 טוקנים ומצב חשיבה מובנה שאפשר לכבות ולהדליק.

  • 1.1Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 724,212הורדות בחודש

מה זה

OpenBMB אימנו כאן מודל קומפקטי שנשען על ארכיטקטורת Llama רגילה, מה שאומר תאימות מיידית לכלים קיימים בלי קוד מותאם. בתהליך האימון הם שילבו שלב זיקוק והסקה שנקרא OPD וחיזוק בעזרת RL, כשהמטרה היא למנוע מודלים קטנים שמייצרים טקסט ארוך ומרוח מדי ללא תועלת. לפי המפתחים, השילוב הזה הוריד ב־29 נקודות אחוז את כמות התשובות שנתקעות בתקרת הטוקנים והעלה את הביצועים במתמטיקה וקוד ב־16 נקודות בממוצע.

בגודל כזה, היתרון המרכזי הוא היכולת לבצע קריאות לכלים בעזרת מבנה XML מובנה, ומעבר בין שתי תצורות עבודה באותו קובץ משקלים: מצב חשיבה מעמיקה ומצב רגיל שמתאים לצ'אט מהיר. הבדיקות שפורסמו מציגות אותו כמוביל בקטגוריית ה־1B מול חלופות כמו Qwen ו־LFM2.5, בעיקר סביב הסקת מסקנות וכתיבת סקריפטים.

מתאים ל

  • סוכן מקומי להרצת כלים

    מבנה ה־XML וספריית SGLang מותאמים להפעלת פונקציות ישירות על המחשב בלי תלות ברשת.

  • עוזר קידוד בסביבת פיתוח

    הוא מציג ציונים טובים בקוד ביחס לגודלו ויכול לרוץ ברקע של עורך הקוד בצריכת משאבים מינימלית.

  • חשיבה לוגית מכוונת במכשיר קצה

    אפשר להדליק את תגית ה־think עבור שאלות מורכבות במתמטיקה ולכבות אותה כשצריך מענה מהיר.

איפה זה נופל

זה עדיין מודל של 1.1 מיליארד פרמטרים, והוא מייצר טעויות עובדתיות ומבוסס רק על דפוסים סטטיסטיים. היוצרים מצהירים במפורש שהוא תומך רק באנגלית ובסינית, כך ששימוש בעברית ייכשל או יניב פלטים משובשים. מעבר לכך, על אף שחלון ההקשר עומד על 131,072 טוקנים, מודל קטן כל כך יתקשה לשמור על דיוק לכל אורך הטקסט אם תעמיסו עליו מסמכים עצומים, והוא לא מתאים למשימות קריטיות ללא בדיקה אנושית.

אותה משפחה

MiniCPM5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

הנתונים הרשמיים מגדירים תמיכה באנגלית ובסינית בלבד. הוא לא אומן על עברית, ולכן לא מומלץ להשתמש בו ליישומים בשפה הזו.

האם צריך כרטיס מסך חזק בשביל להריץ אותו?

לא. המשקלים תופסים 2.0 גיגה בייט בלבד, כך שאפשר להריץ אותו גם על מעבד רגיל או על מעבדי Apple Silicon בעזרת חבילות ה־GGUF וה־MLX.

איך מחליפים בין מצב חשיבה למצב רגיל?

השליטה נעשית דרך ה־chat template בקוד באמצעות הפרמטר enable_thinking, ללא צורך בהורדת משקלים נפרדים.

איך מריצים

המשקלים שוקלים רק 2.0 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בסיסי או מחשב עם מעבד סביר יריצו אותו בלי בעיה. בגלל הארכיטקטורה הסטנדרטית, vLLM ו־SGLang תומכים בו מהקופסה בלי התאמות מיוחדות. אם הצורך שלכם הוא קריאות לכלים, היוצרים ממליצים מפורשות על SGLang עם המפענח הייעודי שלהם.

למי שעובד על מחשבי מק עם Apple Silicon או מכשירי קצה, יש גרסאות GGUF ו־MLX רשמיות בנפרד. אין שום סיבה להשתמש ב־API חיצוני יקר אם כל מה שאתם צריכים זה לנתב פקודות פנימיות, להפעיל סוכן קוד מקומי או לנתח פלט קצר בתוך תהליך קיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/MiniCPM5-1B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לבצע fine-tuning ולשלב אותו בתוך תוכנה סגורה, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗