GPT
M

MiniCPM4.1-8B

קוד פתוח

openbmbapache-2.02025-09-02

  • transformers
  • safetensors
  • minicpm
  • text-generation
  • conversational

מודל 8.2 מיליארד פרמטרים שמיועד למשימות חשיבה, עם תמיכה מובנית בשיטות האצה כמו קשב דליל ומודל טיוטה. הוא מתאים למי שרוצה ביצועים חזקים מקומית בלי לזלול משאבי חישוב מוגזמים.

  • 8.2Bפרמטרים
  • 65,536טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 43,575הורדות בחודש

מה זה

מדובר במודל שפיתחו ב־openbmb כדי לשלב חשיבה מעמיקה עם מהירות ייצור גבוהה על חומרה מקומית. הוא תומך בחלון הקשר של 65,536 טוקנים ומאפשר מעבר בין חשיבה עמוקה לריצה רגילה. המפתחים מציגים מהירות פענוח גבוהה פי שלושה בזמן משימות היסק על כרטיס RTX 4090, בעיקר בזכות שימוש בארכיטקטורת sparse attention ושיטות פענוח ספקולטיבי.

בניגוד למודלים מקבילים בקטגוריית 8B שדורשים משאבים כבדים להקשרים ארוכים, הוא עובר לעבוד עם קשב דליל בטקסטים מעל 8,192 טוקנים כדי לשמור על יעילות. המודל אומן בעיקר על אנגלית וסינית, ודורש שימוש בתבניות פרומפט ספציפיות כדי להוציא ממנו פתרונות מסודרים לשאלות חישוב או ברירה מרובה.

מתאים ל

  • משימות חשיבה על חומרה מקומית

    מציג מהירות גבוהה פי שלושה בהיסק באמצעות שילוב מודל Eagle3 על כרטיסים ביתיים.

  • עיבוד מסמכים ארוכים באנגלית

    תומך בהקשר של 65,536 טוקנים ומאפשר הרחבה עד 131,072 טוקנים באמצעות מנגנון LongRoPE.

  • פתרון בעיות מתמטיות

    מכוונן למתן הסברים שלב אחר שלב והחזרת תשובות בפורמט קבוע כפי שמנחים המפתחים.

איפה זה נופל

הבעיה המרכזית שלו היא התלות בספריות מותאמות, קרנלים ייעודיים ומזלגות קוד כדי לקבל את הביצועים המובטחים. vLLM ו־SGLang תומכות כרגע רק בריצה רגילה בלי קשב דליל, ומנגנון הספקולציה דורש מודל טיוטה ייעודי והתקנות מורכבות ממאגרי גיטהאב חיצוניים. בנוסף, המודל אומן על אנגלית וסינית בלבד, כך שלא כדאי לבנות עליו לפרויקטים בעברית ללא כוונון נרחב, והוא דורש פרומפטים קשיחים מאוד כדי לענות נכון במשימות מתמטיקה ומבחנים.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות ב־vLLM ולקבל את כל יכולות המהירות?

לא את כולן. כרגע vLLM מריץ את המודל רק במצב דחוס רגיל ללא קשב דליל. אם תרצו פענוח ספקולטיבי, תצטרכו להוריד בנפרד את מודל הטיוטה Eagle3 ולהתקין גרסה מותאמת של vLLM מהמאגר של המפתחים.

האם המודל מתאים לעבודה בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא עשוי לפלוט עברית ברמה בסיסית, אבל ללא כוונון ייעודי הוא כנראה ייכשל בהבנה מעמיקה ובמשימות מורכבות בשפה זו.

איך מריצים

המשקל הגולמי שלו בפורמט bfloat16 הוא 15.3 גיגה בייט, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון כדי להריץ אותו בצורה נקייה יחד עם ה־KV cache. מי שמוגבל בחומרה יכול לפנות לגרסאות מקוונטטות כמו GGUF, GPTQ, AutoAWQ או Marlin שזמינות להורדה בנפרד.

אפשר להריץ אותו דרך transformers, vLLM או SGLang, אבל אם אתם רוצים את מלוא מהירות הקשב הדליל תצטרכו להשתמש בקרנלים של InfLLM v2 או במנוע CPM.cu של המפתחים. לצורך פענוח ספקולטיבי מלא צריך להוריד מודל טיוטה נפרד בשם Eagle3, ולכן אם אין לכם סבלנות להגדרות CUDA מותאמות או חומרה מתאימה, עדיף לחפש נקודת קצה מנוהלת במקום להסתבך עם התלויות המקומיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/MiniCPM4.1-8B")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. המשמעות עבורכם היא שאתם יכולים להטמיע אותו במוצרים שלכם, לשנות אותו כרצונכם ולהריץ אותו בתשתיות פנימיות בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗