GPT
M

Mellum2-12B-A2.5B-Thinking

קוד פתוח

JetBrainsapache-2.02026-05-26

  • transformers
  • safetensors
  • mellum
  • text-generation
  • conversational

JetBrains עומדים גם מאחורי JetBrains AI, ויש עליו סקירה כאן.

זה מודל חשיבה קומפקטי שמפעיל רק 2.5 מיליארד פרמטרים מתוך 12 מיליארד בכל שלב. הוא פולט תהליך מחשבה שלם בקוד לפני שהוא עונה, בלי לקרוע את כרטיס המסך.

  • 12Bפרמטרים
  • 131,072טוקנים בהקשר
  • 22.6 GBמשקל הקבצים
  • 2,332הורדות בחודש

מה זה

מדובר במודל MoE עם 64 מומחים שמפעיל שמונה מהם בכל טוקן, כך שמקבלים איכות של מודל בינוני בעלות חישובית של מודל קטן. הוא אומן בשיטות של למידת חיזוק עם תגמולים שניתנים לאימות, ומציג את שרשרת המחשבה שלו בתגיות ייעודיות לפני התשובה הסופית. השילוב של חלון הקשר עצום של 131,072 טוקנים ומנגנון תשומת לב בחלון נע מאפשר לו לעבוד על מסדי קוד ארוכים יחסית.

במבחני ביצועים הוא בולט בעיקר בקוד, עם תוצאה של 69.9 ב־LiveCodeBench v6 שעוקפת מתחרים כמו Qwen3.5 9B ומשאירה מאחור מודלים כמו Ministral 3 14B. עם זאת, הוא לא מנצח בכל תחום. במבחני ידע כללי ומדעים כמו GPQA Diamond הוא מגיע ל־57.6, שזה שיפור ענק לעומת גרסת ה־SFT שלו אבל עדיין נמוך משמעותית ממשפחת Qwen3.5.

מתאים ל

  • דיבאגינג לקוד מורכב

    פולט תהליך מחשבה מסודר ומציג תוצאות גבוהות במיוחד במבחני כתיבת תוכנה.

  • סוכנים עם קריאות לכלים

    תומך בחלון הקשר ענק וכולל יכולות חיבור לכלים חיצוניים שנבדקו ב־BFCL.

  • תכנון משימות מרובות שלבים

    ארכיטקטורת החשיבה מאפשרת לו לפרק בעיות לפני יצירת המענה הסופי.

איפה זה נופל

החולשה המרכזית שלו היא במשימות שדורשות ידע מתמטי מורכב או הבנה מדעית רחבה, שם מתחרים בגודל דומה מציגים פער ניכר לטובתם. במבחן AIME הוא מקבל 58.4 לעומת מעל 73 אצל המתחרים, וב־BS-Bench הוא צונח ל־15 בלבד.

בנוסף, במבחני בטיחות ציון ה־HarmBench שלו עלה ל־20.6 לעומת 12.2 בגרסת ה־SFT, שזה ציון פחות טוב שמראה על סינון חלש יותר. כדאי לזכור גם שהמודל מוגדר רשמית לאנגלית בלבד, כך שלא הייתי בונה עליו לעיבוד מסמכים בעברית בלי בדיקה מקדימה קפדנית.

אותה משפחה

Mellum2-12B-A2.5B יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. הוא עשוי לפלוט עברית בסיסית, אך האימון ושרשרת המחשבה לא כוונו לשפה זו ולא כדאי להסתמך עליו למשימות בעברית.

למה להעדיף אותו על פני גרסת ה־Instruct?

גרסת החשיבה מתאימה למשימות קשות שמצריכות תכנון מקדים ובדיקת שלבים, כמו לוגיקה מסובכת או קוד. אם אתם מחפשים מהירות ותשובה קצרה בלי עיכוב, גרסת ה־Instruct עדיפה.

איך מריצים

כדי להריץ אותו מקומית ב־bfloat16 מלא תצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון, כמו RTX 3090 או 4090, שכן משקל הקבצים עומד על 22.6 גיגה. עם קוונטיזציה אפשר יהיה לרדת לחומרה צנועה יותר. הריצה נתמכת ישירות דרך vLLM עם פרסר ייעודי לחשיבה ולכלים.

אם אתם צריכים רק תשובות ישירות ומהירות בלי עיכוב של שלבי חשיבה, JetBrains מציינים שעדיף לבחור בגרסת ה־Instruct ולא בגרסה הזו. הרצה עצמית כאן משתלמת אם אתם צריכים לנתח קוד מקומי בפרטיות מוחלטת או לבנות סוכנים אוטונומיים שדורשים חלון הקשר ארוך בלי לשלם לפי טוקן לחברות ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="JetBrains/Mellum2-12B-A2.5B-Thinking")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים סגורים. הדרישה היחידה היא לשמור על הצהרת זכויות היוצרים והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗