GPT
G

gemma-4-12B-it-qat-assistant-MTP-Q8_0-GGUF

קוד פתוח

Janvitosapache-2.02026-06-06

  • gguf
  • llama.cpp
  • gemma
  • gemma-4
  • qat

הקובץ הזה משמש כראש עזר עבור פענוח ספקולטיבי, כדי להאיץ את מהירות הפליטה של מודל המטרה. הוא שוקל רק 444 מגה בייט ולא מסוגל לעבוד לבד.

  • 444 MBמשקל הקבצים
  • 2,675הורדות בחודש
  • 38לייקים

מה זה

מדובר בהמרה לפורמט GGUF של ראש העזר הרשמי של גוגל, המיועד למודל gemma-4-12B-it-qat. הוא לא מייצר תשובות בעצמו ולא מחזיק את כל המשקלים של מודל 12B, אלא פועל כרכיב שמציע טוקנים קדימה עבור מודל המטרה הגדול.

המשקל שלו עומד על 444 מגה בייט בלבד, מכיוון שהוא מבודד את ראש הניבוי המקבילי מהצ'קפוינט המקורי של גוגל. מי שמריץ את מודל הבסיס התואם יכול להשתמש בקובץ הזה כדי לסחוט עוד טוקנים בשנייה בלי לפגוע באיכות הפלט הסופית, שכן מודל היעד עדיין מאמת כל טוקן שנחזה.

מתאים ל

  • האצת שרת מקומי

    חיבור ישיר לשרת llama.cpp כדי להעלות את קצב ייצור הטוקנים לשנייה.

  • הורדת זמני תגובה

    שיפור זמני המענה באפליקציות שרצות על גבי מודל היעד התואם.

  • הרצה בחומרה מוגבלת

    סחיטת ביצועים גבוהים יותר ממודל 12B מקומי בלי להוסיף נפח זיכרון משמעותי.

איפה זה נופל

אם תנסו להעלות את הקובץ הזה ישירות לשיחה, הוא לא יעבוד בכלל. הוא מחייב מודל מטרה תואם בדיוק של 12B QAT, כך שאי אפשר להשתמש בו עם מודלים אחרים, עם גרסאות 12B רגילות שלא עברו אימון מודע לכימות, או עם משפחות מודלים שונות. בנוסף, הוא דורש מנוע הרצה שיודע לטפל בפענוח ספקולטיבי ספציפי לג'מה 4.

שאלות
נפוצות

אפשר להשתמש בקובץ הזה כמודל שיחה רגיל?

לא. זהו רק ראש עזר למודל קיים ואין בו את משקלי השפה המלאים. טעינה שלו לבד תסתיים בשגיאה או בפלט שבור.

איזה מודל צריך להוריד לידו כדי שזה יעבוד?

צריך להוריד גרסת GGUF תואמת של gemma-4-12B-it-qat. הקובץ הזה נבדק במקור מול קובץ מטרה בעל כימות תואם שמריץ את אותו צ'קפוינט.

איך מריצים

אתם צריכים גרסה עדכנית של llama.cpp שתומכת בפיצ'ר MTP של ג'מה 4, ומודל מטרה תואם מסוג gemma-4-12B-it-qat בפורמט GGUF. שורת הפקודה דורשת להגדיר את מודל המטרה כרגיל, ולהעביר את הקובץ הזה תחת הדגל model-draft יחד עם spec-type מתאים.

מבחינת משאבים, תוספת הזיכרון של הקובץ הזה זניחה לחלוטין לצד מודל 12B מלא. הבדיקות המקומיות בכרטיס הראו שהגדרה של עד ארבעה טוקנים לחיזוי נותנת יחס עבודה יעיל בין קצב קבלת הניחושים למהירות הריצה הכוללת.

ollama run hf.co/Janvitos/gemma-4-12B-it-qat-assistant-MTP-Q8_0-GGUF:Q8_0

הקבצים

3 קבצים במאגר, 444 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הקבצים ללא תמלוגים. אתם יכולים לשלב אותו בתוך מוצר כל עוד אתם שומרים על הודעת הרישיון המקורית ועומדים בתנאי השימוש של צ'קפוינט המקור של גוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗