GPT
G

gemma-4-E4B-it-ultra-uncensored-heretic-GGUF

קוד פתוח

llmfan46רישיון לא דווח2026-04-05

  • transformers
  • gguf
  • gemma4
  • image-text-to-text
  • heretic

גרסה נטולת סינון למודל הקומפקטי של גוגל, שנבנתה כדי לענות על כל בקשה בלי להטיף מוסר ובלי לקרוס במבחני היגיון וידע כללי.

  • 43.8 GBמשקל הקבצים
  • 47,053הורדות בחודש
  • 183לייקים

מה זה

מדובר בהסבה של gemma-4-E4B-it לפורמט GGUF, שעברה תהליך אבלציה בשם Heretic להסרת מנגנוני הסירוב. המטרה היא לקבל תשובות ישירות גם בנושאים שהמודל המקורי דוחה מיד. לפי הנתונים בכרטיס, שיעור הסירובים צנח מ־99 מתוך 100 במקור ל־3 בלבד בגרסה הזו, כלומר הוא כמעט ולא הודף שאלות.

ההישג הטכני כאן הוא שמירה על היכולות הכלליות. המרחק הסטטיסטי מהמודל המקורי זעיר, עם סטיית KL של 0.0076. במבחן PIQA להבנה פיזית של העולם הוא שומר על 85.85% דיוק מול 86.02% במקור, ובמבחן MMLU לידע כללי הוא יורד קלות מ־69.46% ל־68.60%. ההבדלים האלה זניחים בפועל, כך שלא מדובר במודל שעבר השחתה כדי לשבור גבולות, אלא בכוונון מדויק בשכבות הקשב.

בבסיס שלו יושב מודל עם 4.5 מיליארד פרמטרים פעילים מתוך 8 מיליארד סך הכל, בזכות טבלאות שיבוץ ייעודיות לכל שכבה. הוא תומך בחלון הקשר של 128 אלף טוקנים, תומך בתמונות ובאודיו של עד 30 שניות, ומכיל מנגנון חשיבה מובנה לפני מתן התשובה.

מתאים ל

  • עוזר מקומי לכתיבה יוצרת

    לא נחסם על תיאורי אלימות או נושאים שנויים במחלוקת בעלילה, ורץ על מחשב אישי.

  • תמלול ותרגום קטעי קול קצרים

    מטפל ישירות בקבצי אודיו של עד 30 שניות ללא צורך במודל המרה נפרד.

  • מחקר על מנגנוני סירוב

    בסיס השוואה מצוין מול מודל המקור בזכות מדדי אבלציה מתועדים ורמת דיוק דומה.

איפה זה נופל

במבחן MMLU ניכרת ירידה בנושאים רגישים כמו תרחישים מוסריים, שבהם הדיוק ירד מ־43.91% ל־41.23%. הסרת הבלימות משפיעה בדיוק בנקודות שבהן המודל המקורי נשען על אימוני בטיחות. בנוסף, למרות היכולות הרב־תחומיות, עיבוד הווידאו מוגבל לקצב של פריים בודד לשנייה ועד 60 שניות סך הכל, וקלט הקול מוגבל ל־30 שניות בלבד. לא הייתי משתמש בו לניתוח הקלטות ארוכות או למוצר שחייב מנגנוני הגנה מובנים מפני פלט בעייתי.

שאלות
נפוצות

האם המודל יסרב לפקודות מסוכנות?

בבדיקה שנערכה עליו נרשמו 3 סירובים בלבד מתוך 100 פניות שהכשילו את המודל המקורי. הוא יבצע כמעט כל הוראה שתתנו לו, ולכן אסור לחשוף אותו למשתמשי קצה לא מפוקחים.

איך מפעילים את יכולות הראייה שלו בתוכנות מקומיות?

טעינת קובץ המודל לבדו תאפשר רק עיבוד טקסט. חובה להוריד את קובץ המקרן gemma-4-E4B-it-mmproj-BF16.gguf ולהגדיר אותו בתוכנה שבה אתם משתמשים כדי לנתח תמונות.

האם אפשר להשתמש במודל בעברית?

הבסיס אומן על יותר מ־140 שפות ותומך באופן רשמי בלמעלה מ־35, כך שהוא מבין עברית. עם זאת, תשובות בעברית עלולות להיות איטיות יותר ופחות מלוטשות מאשר באנגלית, במיוחד במודל קומפקטי.

איך מריצים

את קובצי ה־GGUF מריצים בכלים כמו llama.cpp, LM Studio או Ollama. הקבצים מחולקים לכמה רמות דחיסה, החל מ־BF16 המלאה, דרך Q8_0 לשמירה מקסימלית על איכות, ועד Q4_K_M למחשבים עם כרטיסי מסך חלשים יותר. אם אתם רוצים לעבד תמונות, חובה להוריד גם את קובץ המקרן הנפרד gemma-4-E4B-it-mmproj-BF16.gguf ולהטעין אותו לצד המודל.

בגודל של 4.5 מיליארד פרמטרים אפקטיביים, גרסאות ה־Q4 וה־Q5 ירוצו בלי בעיה על מחשבים אישיים עם מעבד גרפי של 8 גיגה זיכרון או אפילו על מעבדי אפל סיליקון בסיסיים. אין כאן סיבה לשלם לספקי ענן או לפנות ל־API חיצוני, המטרה של המודל הזה היא בדיוק לספק ריצה עצמאית, מקומית ופרטית על החומרה שיש לכם בבית.

ollama run hf.co/llmfan46/gemma-4-E4B-it-ultra-uncensored-heretic-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

בכרטיס המודל המקורי מופיע רישיון Apache 2.0 שמאפשר שימוש מסחרי חופשי ושינוי קוד, אבל המפרסם הנוכחי לא הגדיר רישיון רשמי למשקולות שעברו אבלציה. מבחינה משפטית, הוצאת מוצר מסחרי על בסיס קבצים ללא רישיון מוצהר חושפת אתכם לסיכון, ועדיף להגביל את השימוש לניסויים פנימיים או למחקר.

הרישיון המלא בעמוד המודל ↗