GPT
G

gemma-4-12B-it-heretic-GGUF

קוד פתוח

igorlsgemma2026-06-04

  • gguf
  • heretic
  • uncensored
  • decensored
  • abliterated

גרסה נטולת סינון של גוגל ג'מה בגודל 12 מיליארד פרמטרים בפורמט מותאם להרצה מקומית. הוא עונה על בקשות שהמקור חוסם בלי לאבד כמעט מיכולות הבסיס.

  • 18.7 GBמשקל הקבצים
  • 8,361הורדות בחודש
  • 48לייקים

מה זה

מדובר בהמרה של דגם ההוראות המקורי שעברה תהליך אוטומטי להסרת מנגנוני הסירוב באמצעות כלי בשם הרטיק. המטרה כאן היא לקבל תשובות ישירות על נושאים שהדגם של גוגל פשוט מסרב לגעת בהם. במבחני הכרטיס הוא הציג אפס סירובים מתוך מאה בקשות מזיקות, עם מרחק סטטיסטי מזערי של 0.0284 מהמודל המקורי, מה שאומר שההתערבות הכירורגית הזו כמעט לא פגעה בביצועים הכלליים שלו.

הוא מיועד בעיקר למי שמחפש כתיבה יוצרת חופשית או משחקי תפקידים שלא נתקלים בחומות מוסר מלאכותיות בכל משפט שני. בגלל שמדובר בגרסת קווינטוז, הוא נותן את אותה רמת פתיחות בלי שתצטרכו להחזיק שרת כבד כדי לבדוק אותו.

מתאים ל

  • משחקי תפקידים

    מגיב ישירות בלי לעצור על תכנים מורכבים או בוגרים שעוצרים מודלים אחרים.

  • כתיבה יוצרת חופשית

    מאפשר עלילות אפלות ומורכבות בלי הטפות מוסר ובלי סירובים פתאומיים באמצע סיפור.

  • בדיקות חוסן פנימיות

    מצוין לבחינת תרחישי קצה והערכת סיכונים של בקשות מזיקות בסביבה מקומית ומבוקרת.

איפה זה נופל

הסינון הוסר לגמרי, מה שאומר שהמודל ייעתר לכל בקשה בלי שום בלמים פנימיים, כולל תוכן רעיל או פוגעני. אם אתם משלבים אותו בשירות שפונה לקהל רחב, תצטרכו לבנות שכבת בדיקות משלכם כדי למנוע נזק. בנוסף, אם לא תכבו את מצב המחשבה, הדגם יבזבז משאבים על שרשרת הסקת מסקנות ארוכה ויחתוך לכם את הטקסט הסופי לפני שהספיק לסיים אותו.

שאלות
נפוצות

למה התשובות שלו נחתכות לפעמים באמצע?

זה קורה בעיקר כשמצב המחשבה נשאר פעיל. שרשרת החשיבה ממלאת את מכסת הטוקנים עוד לפני כתיבת המענה עצמו, ולכן מומלץ לכבות אותו בהגדרות ההרצה או להגדיל משמעותית את מגבלת הטוקנים לפלט.

כמה זיכרון כרטיס מסך אני באמת צריך בשבילו?

הקובץ המומלץ, ששוקל 7.4 גיגה בייט, ידרוש מכם כרטיס עם 8 עד 12 גיגה זיכרון וידאו כדי לרוץ בצורה טובה. אם תרצו ללכת על גרסת הדיוק הגבוה של 12.7 גיגה בייט, תצטרכו חומרה חזקה יותר עם נפח זיכרון מרווח.

איך מריצים

אתם יכולים לטעון אותו ישירות דרך אולאמה או להריץ בתוכנת לקוח מבוססת לאמה סי פי פי. הגרסה המומלצת היא Q4_K_M ששוקלת בערך 7.4 גיגה בייט ודורשת כרטיס מסך עם שמונה עד שנים עשר גיגה זיכרון כדי לרוץ בצורה חלקה. יש גם גרסת Q8_0 כבדה יותר של 12.7 גיגה בייט ששומרת על דיוק כמעט מלא אבל דורשת יותר חומרה.

ההנחיה הכי חשובה כאן היא לכבות את מנגנון המחשבה. באולאמה פשוט שולחים פקודת nothink או מגדירים אותה בקריאת השרת. במודל הזה החשיבה גוזלת את תקציב הטוקנים ועלולה לקטוע את התשובה הסופית באמצע, במיוחד אם לא מגדילים מראש את חלון ההקשר ומספר הטוקנים לפלט.

ollama run hf.co/igorls/gemma-4-12B-it-heretic-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

4 קבצים במאגר, 18.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון השימוש של ג'מה מבית גוגל. מותר להשתמש בו ולהפיץ אותו, אבל אתם מחויבים לתנאי השימוש ולהגבלות הבטיחות והחוק שהוגדרו במקור. הסרת הסינון בדגם הזה לא פוטרת אתכם מאחריות משפטית על מה שהוא מייצר.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗