GPT
M

MiniCPM-SALA

קוד פתוח

openbmbapache-2.02026-02-11

  • transformers
  • safetensors
  • minicpm_sala
  • text-generation
  • conversational

מודל של 9.5 מיליארד פרמטרים שמשלב קשב דליל עם קשב ליניארי. הוא מיועד למי שרוצה לעבד טקסטים ארוכים במיוחד על כרטיס גרפי בודד בלי לחנוק את הזיכרון.

  • 9.5Bפרמטרים
  • 524,288טוקנים בהקשר
  • 17.7 GBמשקל הקבצים
  • 27,494הורדות בחודש

מה זה

הארכיטקטורה מחלקת את השכבות לשני סוגים, עשרים וחמישה אחוז קשב דליל מסוג InfLLM-V2 לשמירה על פרטים מקומיים, ושבעים וחמישה אחוז קשב ליניארי מסוג Lightning Attention לכיסוי רחב ויעיל. המטרה של השילוב הזה היא להתמודד עם הנפילה בביצועים שמאפיינת מודלים ליניאריים טהורים, בלי לשלם את מחיר החישוב של קשב מלא.

בבדיקות של המפתחים על כרטיס A6000D בהקשר של 256 אלף טוקנים, הוא הציג מהירות הסקה גבוהה פי שלושה וחצי לעומת Qwen3-8B. היתרון המרכזי שמוצג שם הוא היכולת לרוץ על רצפים ארוכים מאוד בלי לקרוס על שגיאות חוסר זיכרון, תופעה שמשביתה מודלי קשב מלא רגילים באורכים כאלה.

מתאים ל

  • ניתוח מסמכי ענק באנגלית

    עיבוד ספרים שלמים או קובצי תיעוד רחבים בחלון הקשר עצום בלי לחרוג מזיכרון ה־GPU.

  • הסקה מקומית על כרטיס בודד

    הרצת רצפים ארוכים של מאות אלפי טוקנים על חומרה כמו RTX 5090 בלי צורך באשכול שרתים.

  • מחקר ארכיטקטורות קשב

    בדיקת שילובים של קשב דליל וליניארי כמחלף למודלי קשב מלא רגילים.

איפה זה נופל

המודל אומן רק על אנגלית וסינית, כך שאין כאן תמיכה מובנית בעברית ולא הייתי בונה עליו לשפה המקומית. ההרצה שלו בשיא היעילות דורשת סביבה מורכבת עם תלויות מקומיות וקימפול קרנלים ב־C++, מה שמסרבל פריסה מהירה בשרתים רגילים. בנוסף, המפתחים מדגישים שהתוצרים דורשים בדיקה ואימות עצמאיים וממליצים להריץ אותו בטמפרטורה גבוהה יחסית של 0.9.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא לא מיועד לעברית, ואם תנסו להזין לו טקסט מקומי הביצועים צפויים להיות ירודים מאוד.

האם אפשר להריץ אותו ישר מ־transformers בלי סיבוכים?

אפשר להעלות אותו עם קוד בסיסי של transformers ודגל trust_remote_code. יחד עם זאת, כדי לקבל את החיסכון בזיכרון ואת המהירות בהקשרים ארוכים, תצטרכו לקמפל את הקרנלים של SGLang.

איך מריצים

בפועל אפשר לטעון אותו דרך ספריית transformers הרגילה עם trust_remote_code מופעל, אבל כדי להגיע לביצועים המדווחים על רצפים ארוכים צריך להשתמש במימוש SGLang ייעודי. זה כולל קימפול ידני של קרנלים ב־CUDA 12 ומעלה והתקנת ספריות כמו flash-linear-attention ו־tilelang.

משקל הקבצים עומד על 17.7 גיגה־בייט ב־bfloat16, מה שדורש כרטיס עם לפחות 24 גיגה־בייט זיכרון דוגמת RTX 5090 או A6000D. אם אין לכם חומרה כזו או שאין לכם כוח להתעסק בקימפול הרחבות מקומיות, עדיף להמתין לשירותי ענן שיריצו אותו כ־API.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/MiniCPM-SALA")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה של המודל בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗