GPT
M

Mellum2-12B-A2.5B-Instruct

קוד פתוח

JetBrainsapache-2.02026-05-26

  • transformers
  • safetensors
  • mellum
  • text-generation
  • conversational

JetBrains עומדים גם מאחורי JetBrains AI, ויש עליו סקירה כאן.

מודל MoE קומפקטי מבית ג'טבריינס שמפעיל רק 2.5 מיליארד פרמטרים לטוקן. הוא נועד לתת מענה מהיר לכתיבת קוד והפעלת כלים בלי שרשרת חשיבה כבדה ומסורבלת.

  • 12Bפרמטרים
  • 131,072טוקנים בהקשר
  • 22.6 GBמשקל הקבצים
  • 2,624הורדות בחודש

מה זה

ג'טבריינס בנו מודל מבוסס תערובת מומחים עם שישים וארבעה מומחים בסך הכול, כאשר שמונה מתוכם פעילים בכל רגע נתון. המבנה הזה מאפשר לקבל קיבולת של מודל שנים עשר מיליארד פרמטרים, אבל לשמור על זמני תגובה ועלויות חישוב של מודל קטן בהרבה. הוא מגיע עם חלון הקשר של מאה שלושים ואחד אלף טוקנים שמשלב חלונות תשומת לב גולשים, ועבר אימון עם תגמולים על משימות תכנות מעשיות, מתמטיקה והפעלת כלים.

במבחני ביצועים, התמונה מורכבת. בכתיבת קוד לפי EvalPlus הוא מגיע לציון של 78.4 ועוקף דגמים כמו קוון 3.5 בגדלי 4B ו־9B. מנגד, במבחני קידוד חיים כמו LiveCodeBench הוא נעצר על 37.2 אחוז, הרחק מאחורי המתחרים הסיניים. זה אומר שהוא מצטיין במשימות תכנות שגרתיות ומוגדרות היטב, אך מבריק פחות כשהאתגר דורש אלגוריתמיקה מורכבת.

מתאים ל

  • השלמת קוד מקומית

    זמן תגובה קצר בזכות הפעלת חלק קטן מהפרמטרים בכל טוקן, בלי עיכובים של חשיבה ממושכת.

  • סוכן להפעלת פונקציות

    תמיכה מובנית בחיבור כלים עם ביצועים טובים במבחני BFCL ואינטגרציה פשוטה לשרתי הסקה.

  • ניתוח בסיסי של ריפוזיטורי

    חלון הקשר גדול שמאפשר להזין מספר רב של קובצי פרויקט בו זמנית כדי לקבל מענה ממוקד.

איפה זה נופל

הוא לא מיועד לפתרון בעיות סבוכות שמצריכות חשיבה ארוכה, ולמשימות כאלה ג'טבריינס עצמם מכוונים לגרסת ה־Thinking. במבחני ידע כללי ומדע כמו GPQA הוא מקבל 40.9 אחוז בלבד, חצי ממה שמציגים מודלים מקבילים, ובמבחן הבלופים BS-Bench הוא קרס ל־18 אחוז. בנוסף, המודל אומן ותועד רק באנגלית, כך שלא כדאי לבנות עליו לפרויקטים שדורשים עברית.

אותה משפחה

Mellum2-12B-A2.5B יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יכול להחליף את קוון כמנוע קידוד ראשי?

במשימות סטנדרטיות הוא יספק מענה מהיר ויעיל, כפי שמראים המבחנים ב־EvalPlus. אבל באלגוריתמיקה כבדה או בפתרון בעיות תחרותיות הוא מפגר משמעותית בביצועים.

איך הוא מתמודד עם טקסטים בעברית?

כרטיס המודל מציין תמיכה בשפה האנגלית בלבד. סביר להניח שהוא יציג תוצאות חלשות מאוד או ישבר לחלוטין אם תנסו לעבוד איתו בעברית.

איך מריצים

המשקל הכולל של הקבצים מגיע לכמעט עשרים ושלושה גיגה־בייט, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון כדי להעלות אותו בפורמט bfloat16 מקורי. מריצים אותו ישירות דרך vLLM עם פרמטרים מובנים לזיהוי קריאות לפונקציות, באמצעות תאימות לפארסר של הרמס.

אם חלון ההקשר מנוצל עד הסוף, צריכת הזיכרון לטבלאות הקשר תדרוש כרטיס חזק בהרבה או חלוקה בין כמה מעבדים גרפיים. אם אין לכם חומרה ייעודית שרצה ברציפות, עדיף לפנות למודל מרוחק, בעיקר אם אתם מתכננים לעבד מסמכים ארוכים במיוחד.

from transformers import pipeline

pipe = pipeline("text-generation", model="JetBrains/Mellum2-12B-A2.5B-Instruct")
print(pipe("שלום"))

הרישיון

הפצה תחת רישיון אפאצ'י 2.0 המוכר. אפשר להשתמש בו חופשי לפיתוח מוצרים מסחריים, להטמיע אותו בתוך שירותים סגורים או לשנות את הקוד והמשקלים. התנאי היחיד הוא שמירה על זכויות היוצרים וההצהרה המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗