GPT
G

gemma-4-12B-it-heretic-QAT-GGUF

קוד פתוח

SC117apache-2.02026-06-08

  • gguf
  • quantized
  • qat
  • heretic
  • uncensored

גרסה פתוחה מחסימות של גוגל ג'מה 4 בגודל 12B, שמגיעה בכימות 4 ביט שנשען על אימון ייעודי למניעת אובדן איכות. מתאימה למי שרוצה ביצועים מדויקים על כרטיס מסך בודד בלי סירובי צנזורה.

  • 6.4 GBמשקל הקבצים
  • 10,703הורדות בחודש
  • 48לייקים

מה זה

מדובר בעיבוד של המודל הרשמי של גוגל, שעבר הסרת חסמים באמצעות תהליך שנקרא Heretic ARA. המטרה היתה לנטרל את נטיית המודל לסרב לבקשות. במבחן הסירובים המוצג בכרטיס, שיעור הסירוב צנח מ־99 מתוך 100 ל־8 בלבד, כאשר מדד הסטייה מההתנהגות המקורית נשמר נמוך מאוד ועומד על 0.0575, מה שאומר שהוא שומר על היכולות המקוריות כמעט במלואן.

הייחוד הטכני כאן נובע משימוש במשקולות שהוכשרו מראש לכימות של 4 ביט על ידי גוגל עצמה. בזכות ההכשרה הזו, דיוק ה־Top-1 בכימות Q4_0 מגיע ל־88.8%, לעומת 74.1% בלבד בכימות רגיל ללא אימון מקדים. בנוסף, המבנה שלו מוגדר כמולטימודלי ללא צורך במקודד חיצוני נפרד, ותומך בטקסט, תמונה, אודיו ווידאו ישירות מתוך המודל עצמו.

מתאים ל

  • עוזר פיתוח וכתיבת קוד

    דיוק של 88.8% בכימות קל של 6.4GB, עם הגדרות טמפרטורה ייעודיות לקוד שרצות מקומית על 8GB VRAM.

  • עיבוד מדיה ללא מקודד חיצוני

    קליטת טקסט, תמונה, אודיו ווידאו בארכיטקטורה אחודה אחת, בלי צורך להחזיק מודלי ראייה נפרדים בזיכרון.

  • מחקר ועיבוד טקסט ללא צנזורה

    מוריד את שיעור הסירובים מ־99% ל־8% בלבד, ומאפשר עיבוד נושאים רגישים שמודלים רגילים נוטים לחסום מיד.

איפה זה נופל

למרות שהשם של הקובץ עשוי להזכיר כימות דינמי מעורב, מדובר בפועל בכימות אחיד מסוג Q4_0 שבו רק טנזורי הנרמול נשארו בדיוק מלא. הסרת החסמים מפחיתה דרסטית את מנגנוני הבטיחות המקוריים, כך שהמודל עלול לפלוט תוכן פוגעני או רעיל ללא סינון, ולא מתאים כברירת מחדל למוצרים עם חשיפה לקהל רחב ללא שכבת הגנה חיצונית.

שאלות
נפוצות

האם הקובץ הוא באמת כימות דינמי מעורב מסוג UD-Q4_K_XL?

לא. המפרסם מציין בפירוש ששם הקובץ משקף רק מוסכמת שמות, אך כל משקולות המודל שמורות בפורמט אחיד של Q4_0, כאשר רק טנזורי הנרמול והסקיילינג נשמרו ב־F32.

איזה כרטיס מסך נדרש כדי להריץ את המודל מקומית?

הקובץ כולו תופס 6.4 גיגהבייט ולכן נכנס במלואו לכרטיס מסך עם 8GB VRAM להרצה בסיסית. עם זאת, אם תרצו לנצל הקשרים ארוכים משמעותית מעבר להקשר של כמה אלפי טוקנים, תצטרכו זיכרון נוסף בשביל ה־KV Cache.

איך מריצים

הקובץ שוקל 6.4 גיגהבייט ורץ בקלות על כרטיס מסך בודד עם 8GB VRAM. הוא נתמך ישירות בכל סביבת GGUF מוכרת כמו llama.cpp, LM Studio, Jan או koboldcpp, ללא צורך בהגדרת פרויקטור נפרד לקלט של תמונות או קול.

לצורך הרצה ב־llama.cpp צריך להשתמש בדגל jinja, ומומלץ להגדיר בפרמטרים ביטול של תכונת החשיבה הפנימית. אם אין לכם חומרה מקומית מתאימה או שאתם מתכננים לנצל את כל חלון ההקשר המלא של 256,000 טוקנים, תצטרכו זיכרון משמעותי הרבה מעבר למינימום הבסיסי, ושם כבר עדיף לשקול פתרון ענן.

ollama run hf.co/SC117/gemma-4-12B-it-heretic-QAT-GGUF:BF16

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

5 קבצים במאגר, 6.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא Apache 2.0. הרישיון מאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקולות והפצה שלהם, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי. מתאים למי שרוצה לשלב את המודל בתוך מוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗