GPT
G

gemma-4-31B-it-uncensored-heretic

קוד פתוח

llmfan46apache-2.02026-04-03

  • transformers
  • safetensors
  • gemma4
  • image-text-to-text
  • heretic

גרסה שעברה הסרת צנזורה למודל Gemma 4 של גוגל בגודל 31 מיליארד פרמטרים. היא פונה למי שנמאס לו מסירובים ומהרצאות מוסר על בקשות תמימות, ורוצה מודל מולטימודלי מלא על חומרה מקומית.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 58.3 GBמשקל הקבצים
  • 56,062הורדות בחודש

מה זה

הבסיס כאן הוא מודל התמונות והטקסט של גוגל, שעבר טיפול אבלציה בשיטת Heretic כדי לנטרל את מנגנוני הסירוב המובנים שלו. לפי הנתונים בכרטיס, שיעור הסירובים צנח מ־99 מתוך 100 במקור ל־10 בלבד בגרסה הזו. זה אומר שבמקום לקבל הטפות מוסר או התחמקויות, המודל פשוט עונה לפרומפט, תוך שמירה על ביצועים כמעט זהים עם מרחק KL של 0.0541 ביחס למקור.

במבחן הידע MMLU הוא רשם 85.90% דיוק לעומת 86.50% במקור, הבדל זניח שמראה שההתערבות ברקמות המודל לא פגעה בחוכמה הכללית שלו. הוא תומך בניתוח תמונות, קריאת מסמכים, וידאו, ומציע חלון הקשר ענק של 256K טוקנים.

מתאים ל

  • ניתוח מסמכים רגישים

    פענוח דוחות או חומרים משפטיים ורפואיים שהיו מקפיצים למודל רגיל אזהרות סירוב מיותרות.

  • סוכן בדיקות חדירה

    יצירת תרחישי תקיפה ובדיקת חולשות קוד ואבטחה בלי להיתקל בחסימות של תוכן מסוכן.

  • עיבוד תמונות ומסמכים

    קריאת צילומי מסך ותרשימים ארוכים אל תוך חלון הקשר של 256K בלי תלות ברשת חיצונית.

איפה זה נופל

ההתערבות במשקלים אמנם הורידה את הסירובים, אבל במבחני MMLU רואים ירידות נקודתיות מורגשות בתחומים מסוימים, למשל בביולוגיה, מדעי המדינה או למידת מכונה. בנוסף, מודל לא מצונזר יפלוט טעויות, תוכן רעיל או הוראות שגויות בלי להניד עפעף, מה שמחייב אתכם לבנות שכבת בדיקות משלכם אם אתם חושפים אותו למשתמשי קצה. חשוב גם לזכור שאין לו תמיכה מובנית באודיו, בניגוד לגרסאות הקטנות יותר של הסדרה.

אותה משפחה

gemma-4-31B-it-uncensored-heretic יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מבין עברית?

הבסיס של גוגל אומן על מעל 140 שפות וכולל עברית, אבל איכות הפלט תלויה במשימה. לטקסטים פשוטים זה יעבוד, אך בניסוחים מורכבים עדיף לבדוק אותו מראש מול משימות המטרה שלכם.

האם אני חייב להוריד 58GB כדי להשתמש בו?

לא. המשקל הזה מיועד למשקלי המקור המלאים בטרנספורמרס. יש גרסאות GGUF מכווצות שמתאימות ל־llama.cpp ומאפשרות להריץ אותו בקלות על כרטיסי מסך סטנדרטיים או מעבדים חזקים.

מה קורה למנגנון החשיבה במודל הזה?

מנגנון ה־Thinking של Gemma 4 עדיין קיים וניתן להפעלה בעזרת הטוקן הייעודי בפרומפט המערכת. הוא מציג את שלבי החשיבה לפני התשובה, אלא אם מבטלים אותו בהגדרות.

איך מריצים

המשקל המלא שוקל 58.3 גיגה בייט, כך שלהרצה ב־FP16 מלא תצטרכו שרת עם לפחות שני כרטיסי A100 או H100 של 80GB כדי להשאיר מקום לקונטקסט. למחשב ביתי או שרת קטן יותר זה כבד מדי בצורתו הגולמית.

אם אתם לא מחזיקים אשכול שרתים ייעודי, עדיף להוריד את גרסאות ה־GGUF או ה־NVFP4 שהועלו בנפרד. גרסת קוונטיזציה של 4 ביט תיכנס על כרטיס בודד של 24GB דוגמת RTX 3090 או 4090, ושם זה מתחיל להיות הגיוני להרצה עצמאית בלי לשלם עשרות דולרים לענן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="llmfan46/gemma-4-31B-it-uncensored-heretic")
print(pipe("שלום"))

הרישיון

הפרויקט מדווח תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית בלי תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים. יחד עם זאת, כיוון שמדובר במשקלים שעברו שינוי של מודל מקורי מגוגל, מומלץ לוודא שאין סתירה מול תנאי השימוש המקוריים של Gemma לפני שמטמיעים אותו במוצר מסחרי רחב.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗