GPT
M

Mellum2-12B-A2.5B-Thinking-GGUF-Q4_K_M

קוד פתוח

JetBrainsapache-2.02026-06-03

  • gguf
  • mellum
  • llama.cpp
  • quantized
  • moe

JetBrains עומדים גם מאחורי JetBrains AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה מכווצת של מודל מומחים מבית JetBrains, שמציע תהליך חשיבה מפורט בחלון הקשר ענקי ובמשקל שרץ מקומית.

  • 7.5 GBמשקל הקבצים
  • 2,930הורדות בחודש
  • 44לייקים

מה זה

מדובר בארכיטקטורת Mixture-of-Experts שמחזיקה 12 מיליארד פרמטרים בסך הכול, אבל מפעילה רק 2.5 מיליארד בכל טוקן דרך שמונה מומחים מתוך שישים וארבעה. הפיצול הזה מאפשר לו לעבד מהר יחסית תוך שמירה על ידע רחב, כשהוא פולט את שרשרת המחשבה המלאה שלו בתוך תגיות ייעודיות לפני שהוא מחזיר את התשובה הסופית.

הגרסה הזו מכווצת לדיוק של ארבעה ביטים ומגיעה לקובץ של כ־8.1 גיגה בייט. לפי הבדיקות של החברה מול גרסת המקור הלא מכווצת, הוא שומר על התאמה של קרוב לתשעים אחוז בטוקנים המובילים ואיבוד מידע נמוך מאוד, כך שמקבלים כמעט את אותן התוצאות בחצי מנפח הזיכרון.

מתאים ל

  • פתרון בעיות תכנות מורכבות

    ארכיטקטורת החשיבה ותגיות הניתוח עוזרות למצוא באגים עמוקים בקוד באנגלית לפני הפקת הפתרון.

  • ניתוח מסמכים טכניים ארוכים

    חלון של 131,072 טוקנים מאפשר להזין תיעוד מלא ולקבל הסברים לוגיים מנומקים.

  • הרצה מקומית על מחשבי פיתוח

    משקל של שמונה גיגה בייט מאפשר בדיקות פרטיות על מחשב נייד בלי להוציא קוד החוצה לרשת.

איפה זה נופל

המודל הוכשר ומוגדר רשמית לשפה האנגלית בלבד, כך שלא כדאי לבנות עליו לפרויקטים בעברית או למשימות רב־לשוניות מורכבות. נוסף על כך, מכיוון שהוא מפיק בלוק חשיבה מפורט לפני כל מענה, הוא מבזבז טוקנים וזמן יקר על משימות פשוטות שדורשות תשובה קצרה ומידית. אם הקוד שלכם לא יודע לחתוך או להסתיר את תגיות החשיבה, הפלט הגולמי ישבור ממשקים קיימים.

שאלות
נפוצות

כמה זיכרון באמת צריך כדי לנצל את כל ההקשר?

המודל עצמו תופס סביב 8.1 גיגה בייט בזיכרון, אבל חלון של 131 אלף טוקנים דורש תוספת זיכרון אדירה עבור ה־context. בפועל, הרצה באורך מלא תחייב כרטיס מסך עם זיכרון גבוה מאוד או זיכרון מערכת משמעותי במחשב, אחרת תקבלו שגיאת זיכרון מיד כשהטקסט יתארך.

האם המודל מתאים למענה קולי או לצ'אט מהיר?

לא ממש. המודל בנוי לייצר מחשבות בתוך תגיות ייעודיות לפני שהוא מתחיל לכתוב את התשובה הסופית, מה שמוסיף השהיה מורגשת לכל פלט. אם אתם צריכים זמן תגובה אפסי לשאלות פשוטות, תהליך החשיבה המובנה שלו רק יפריע לכם.

איך מריצים

את הקובץ מריצים ישירות דרך llama.cpp, Ollama או LM Studio. גודל הקובץ דורש לפחות עשרה גיגה בייט של זיכרון עבודה או זיכרון כרטיס מסך כדי להחזיק את המשקלים בנוחות, אבל אם תרצו לנצל את מלוא חלון ההקשר שמגיע ל־131,072 טוקנים, תצטרכו להקצות עוד עשרות גיגה בייטים של RAM רק עבור ה־KV cache.

יש גרסאות קלות יותר כמו MXFP4 שתופסת שבעה גיגה בייט, או כבדות כמו Q8_0 שמגיעה ל־12.9 גיגה בייט. אם אין לכם כרטיס מסך מתאים עם מספיק זיכרון להקשרים ארוכים, הקמה ותחזוקה של שרת ייעודי מקומי תהיה יקרה וכדאי לחשוב על API חיצוני.

ollama run hf.co/JetBrains/Mellum2-12B-A2.5B-Thinking-GGUF-Q4_K_M:Q4_K_M

הקבצים

3 קבצים במאגר, 7.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשלב אותו במוצרים פנימיים או חיצוניים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗