GPT
G

Gemmable-4-12B-MTP-GGUF

קוד פתוח

Mia-AiLabרישיון לא דווח2026-06-18

  • gguf
  • gemma-4
  • gemmable
  • reasoning
  • assistant-traces

גרסת GGUF של גמא 4 עם 12B פרמטרים שעברה אימון על נתוני Fable-5. היא מגיעה עם קובצי עזר להאצת פענוח ספקולטיבי בריצה מקומית.

  • 29.7 GBמשקל הקבצים
  • 491,456הורדות בחודש
  • 50לייקים

מה זה

הפרויקט הזה לוקח את מודל הבסיס של גוגל ומאמן אותו על עקבות חשיבה ושיחה בסגנון Fable-5. התוצאה מכוונת ישירות למשימות קוד, פתרון בעיות מורכבות ועבודה מול משתמשים. הייחוד העיקרי כאן הוא החלוקה לצמדים. לצד קובץ המודל הראשי מקבלים קובץ עזר תואם שמיועד להאצת הפענוח בשיטת draft-MTP, כך שאפשר להריץ אותו מהר יותר על חומרה מקומית תומכת.

במקום לקבל רק משקלים רגילים בפורמט GGUF, היוצרים סיפקו חבילה שלמה שכוללת גרסת fp16 מלאה יחד עם גרסאות מכווצות וקובצי הטיוטה התואמים שלהן. זה נותן מענה למי שרוצה להריץ מודל של 12 מיליארד פרמטרים בקצב הפקה גבוה יותר בלי לשלם על מודל ענק אחר, כל עוד כלי ההרצה שלכם כבר כולל את התמיכה במנגנון הספציפי הזה.

מתאים ל

  • הסקה מקומית עם האצה

    מיועד להרצה מקומית על llama.cpp תוך שימוש בקובצי ה־MTP להשגת קצב טוקנים גבוה.

  • עוזר פיתוח וכתיבת קוד

    האימון על Fable-5 מכוון לשיפור ניתוח בעיות והפקת קוד בלי תלות ברשת חיצונית.

  • עבודה כעוזר אישי מנותק

    מספק יכולת חשיבה מונחית ומענה לשיחות ישירות על החומרה שלכם.

איפה זה נופל

ההסתמכות על מנגנון ה־MTP היא גם החיסרון הבולט ביותר כאן. אם כלי ההרצה שלכם לא תומך ב־draft-mtp עבור גמא 4, תצטרכו להסתפק בריצה רגילה ואיטית יותר, או להמתין לעדכוני תוכנה רשמיים. בנוסף, מדובר במודל שעבר כוונון ייעודי ולא במודל הבסיס הגולמי של גוגל, מה שאומר שהתשובות מוטות לכיוון סגנון החשיבה של Fable-5. איכות הפלט תלויה מאוד בניסוח הפרומפט ובהגדרות זמן הריצה, ואין פה מדדי ביצועים רשמיים שמאמתים את רמת הדיוק מול מודלים אחרים.

שאלות
נפוצות

האם חייבים להוריד את שני הקבצים כדי שהמודל יעבוד?

לא. אפשר להוריד רק את הקובץ הראשי ולהריץ אותו רגיל לחלוטין. קובץ ה־mtp נחוץ רק אם אתם רוצים להפעיל פענוח ספקולטיבי כדי לקבל קצב הפקה גבוה יותר.

למה המנגנון המהיר לא עובד אצלי ב־LM Studio?

נכון לגרסאות מאי 2026, הגרסה הראשית של LM Studio עדיין לא כוללת תמיכה ב־draft-mtp עבור המודל הזה. כדי שזה יעבוד צריך גרסה עם התיקון הייעודי שהוטמע או שימוש ישיר ב־llama.cpp מעודכן.

איך מריצים

טוענים את המודל ישירות דרך llama-server או LM Studio. אם רוצים את מלוא המהירות של הפענוח הספקולטיבי, מעבירים לפקודת ההרצה גם את קובץ ה־mtp התואם לרמת הקוונטיזציה שבחרתם, כמו למשל קובץ ראשי Q4_K_M עם קובץ עזר זהה.

משקל כלל הקבצים בריפו מגיע ל־29.7 גיגה-בייט, אבל בפועל מורידים רק צמד קבצים יחיד שמתאים לגודל הזיכרון שלכם. מודל 12B בקוונטיזציה של 4 ביט ירוץ בנוחות על כרטיס מסך עם 12 גיגה זיכרון. אם אין לכם חומרה ייעודית או שאתם לא צריכים ריצה מקומית ומנותקת, שירות ענן חוסך את כאב הראש של ניהול קובצי העזר והרצת שרת מקומי.

ollama run hf.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

היוצרים לא דיווחו על רישיון כלל בעמוד המודל. במצב כזה אין אישור שימוש מפורש, ואי אפשר לדעת אילו הגבלות מסחריות חלות עליו מעבר לרישיון המקורי של גוגל. שילוב של קבצים כאלה במוצר מסחרי יוצר סיכון משפטי ברור.

הרישיון המלא בעמוד המודל ↗