GPT
M

MiniCPM5-2B

קוד פתוח

openbmbapache-2.02026-09-06

  • transformers
  • safetensors
  • llama
  • text-generation
  • minicpm

מודל קומפקטי שמכוון לריצה מקומית, עם ביצועים שמנצחים מודלים כפולים ממנו בגודל. הוא מציע שילוב נדיר של חלון הקשר ענק ויכולת תכנות גבוהה בקובץ של 4.7 גיגה.

  • 2.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 4.7 GBמשקל הקבצים
  • 2,879הורדות בחודש

מה זה

מדובר במודל טקסט צפוף מבוסס ארכיטקטורת LlamaForCausalLM, שפותח במטרה לתת מענה לתהליכי עבודה מקומיים, הפעלת כלים ומשימות של סוכנים אוטונומיים. הוא אומן בין היתר באמצעות תהליכי RL ייעודיים וסטים של מאות אלפי דוגמאות לקוד והפעלת סוכנים.

התוצאות במבחנים מסבירות את העניין סביבו. במדד LiveCodeBench v6 הוא מציג ציון של 69.1, ובממוצע הכללי עומד על 53.9. לשם השוואה, מודלים פופולריים כמו Qwen3.5-4B מגיעים לציון 51.1 בלבד באותם מבחנים, מה שאומר שבמשימות של הסקת קוד ומתמטיקה הוא עוקף מודלים עם נפח כפול של משקלים.

מתאים ל

  • סוכן פיתוח מקומי

    הציון הגבוה בבדיקות קוד מאפשר לתת לו לנתח פונקציות ולייצר סקריפטים בסביבה מבודדת.

  • קריאת מסמכים ארוכים באנגלית

    הקשר של 131,072 טוקנים מתאים להזנת קבצי לוג ענקיים או מסמכים שלמים במכונה מקומית.

  • אוטומציה והפעלת כלים

    אימון ייעודי על דאטה של סוכנים מסייע לו לתרגם הוראות לקריאות API וכלים חיצוניים.

איפה זה נופל

הנתונים מציגים תמיכה רשמית באנגלית ובסינית בלבד. אין שום תיעוד ליכולות בעברית, ובמודלים בגודל כזה היעדר אימון מפורש גורר בדרך כלל פליטת ג'יבריש או תחביר שבור.

מעבר לזה, למרות שהמודל תומך בחלון הקשר של 131,072 טוקנים, מילוי חלון כזה בזיכרון דורש משאבי KV-cache משמעותיים שיכולים לחנוק כרטיס גרפי קטן, וחשוב לבחון האם הדיוק במיצוי מידע נשמר לאורך כל הטווח.

אותה משפחה

MiniCPM5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל לשיחה שוטפת בעברית?

לא מומלץ. המודל אומן והוגדר רשמית עבור אנגלית וסינית, כך שפלט בעברית צפוי להיות לא יציב או משובש לחלוטין.

האם באמת צריך כרטיס מסך חזק בשביל להריץ אותו?

ממש לא. בגרסת המקור מספיק כרטיס מסך עם 8 גיגה, ובגרסאות GGUF אפשר להריץ אותו אפילו על מחשב נייד רגיל ללא כרטיס ייעודי.

האם חלון ההקשר הגדול אומר שאפשר להעמיס עליו תמיד 130 אלף טוקנים?

טכנית כן, אבל הזיכרון של ה־KV cache יגדל בצורה חדה ככל שהקלט מתארך, מה שידרוש הרבה יותר זיכרון מחשב מהמשקל הבסיסי של המודל.

איך מריצים

המשקל המלא בדיוק bfloat16 תופס 4.7 גיגה, כך שכרטיס מסך בודד עם 6 עד 8 גיגה זיכרון יחזיק אותו בקלות. למי שמריץ על מעבדי אפל או חומרה ביתית צנועה, יש גרסאות מכווצות בפורמטים כמו GGUF ו־MLX שמורידות את דרישות הזיכרון לאזור ה־4 ביט.

אם אתם צריכים רק מענה לשאלות פשוטות פה ושם, חבל על המאמץ של תחזוקת תשתית מקומית. שווה להריץ אותו לבד בעיקר כשנדרשת פרטיות מלאה, כשעובדים ללא רשת, או כשיש צורך להריץ כמות אדירה של קריאות מהירות לסוכן מקומי בלי לשלם פר טוקן.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/MiniCPM5-2B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו בקוד סגור, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗