GPT
G

Gemma4-31B-QAT-Uncensored-HauhauCS-Balanced-MTP

קוד פתוח

HauhauCSgemma2026-06-24

  • gguf
  • uncensored
  • gemma4
  • vision
  • multimodal

גרסה נטולת סירובים למודל 31B של גוגל שמגיעה מכוילת ל־4 ביט וכוללת ראש חיזוי שמאיץ את הריצה. היא מתאימה למי שצריך מודל חזק שלא יטיף מוסר או ייעצר על שטויות.

  • 18.8 GBמשקל הקבצים
  • 370,489הורדות בחודש
  • 155לייקים

מה זה

מדובר בהתאמה של HauhauCS ל־Gemma 4 בגודל 31 מיליארד פרמטרים, שמטרתה העיקרית היא לנקות את מנגנוני הסירוב המקוריים של גוגל. לפי הבדיקות של היוצר, המודל עמד ב־465 מבחני סירוב בלי לחסום פנייה אחת. הוא בנוי על משקולות שעברו אימון מותאם לכימות, מה שאומר שהדחיסה ל־4 ביט לא פוגעת ביכולות לעומת דיוק מלא.

המודל כולל עיבוד תמונה באמצעות קובץ הרחבה נפרד, ותומך בהקשר של 256 אלף טוקנים. היתרון הגדול שלו לעומת חלופות באותו גודל הוא ראש חיזוי מרובה טוקנים שנלקח מ־Unsloth. התוסף הזה מייצר מהירות גבוהה בכ־53 אחוזים באמצעות פענוח משוער, בלי לשנות את התוכן שהמודל פולט בפועל.

מתאים ל

  • פיתוח סוכני קוד ואוטומציה

    חשיבה מובנית והיעדר סירובים מאפשרים לו לנתח קוד וסביבות פיתוח בלי לחסום משימות תחזוקה רגישות.

  • ניתוח מסמכים ותמונות

    שילוב קובץ הראייה עם חלון הקשר עצום מאפשר לפרוק מידע ויזואלי ומסמכים ארוכים בריצה מקומית מהירה.

  • כתיבה יצירתית ללא סינון

    התאמת המודל מונעת הטפות מוסר או חסימות מיותרות בנושאים מורכבים שעוצרים מודלים מסחריים סגורים.

איפה זה נופל

המודל מוגדר רשמית כעובד באנגלית בלבד, כך שאין שום הבטחה לרמת העברית שלו. בנוסף, המפתח מודה שקיימים מקרי קצה שבהם המודל מתחמק בתשובה הראשונה ודורש ניסוח מחדש כדי לשתף פעולה. חשוב לזכור שנטילת מנגנוני הבטיחות מבטלת כל סינון, ולכן חייבים לבדוק מה הוא פולט לפני שמחברים אותו למוצר מול משתמשים.

שאלות
נפוצות

למה יש להורדה רק קובץ בכימות Q4 ולא גרסאות מדויקות יותר?

המודל אומן מראש תחת שיטת כימות מיוחדת של גוגל שמותאמת ל־4 ביט. בגלל תהליך האימון הזה, קבצים ברמת דיוק גבוהה יותר רק מגדילים את נפח האחסון ולא נותנים שום שיפור אמיתי באיכות התשובות.

איך מגיעים לתוספת המהירות המובטחת של 53 אחוזים?

צריך להריץ את המודל דרך llama.cpp ולהטעין במקביל את קובץ ה־MTP המצורף. ראש החיזוי מנחש טוקנים קדימה והמודל הראשי רק מאמת אותם, מה שמקצר את זמן הריצה בלי לגעת באיכות הפלט.

איך מריצים

כדי להריץ אותו צריך חומרה שמסוגלת להחזיק כ־19 גיגה בייט של קובץ ה־GGUF יחד עם עוד גיגה ורבע לתמיכה בתמונות, פלוס זיכרון נוסף להקשר הרחב. הוא מיועד בעיקר ל־llama.cpp, שם אפשר להפעיל במקביל גם את ראש החיזוי וגם את קובץ הראייה בפקודה אחת.

אם אתם עובדים עם LM Studio, שימו לב שהיוצר מדווח על קריסות בחלוקת עומס בין כמה כרטיסים במצב טנסור ספליט, ולכן עדיף להגדיר כרטיס יחיד או חלוקת שכבות. אם אין לכם מעבד גרפי עם מספיק זיכרון להחזיק מעל עשרים גיגה נטו, שווה לבדוק ממשקי ענן במקום לחנוק את המחשב המקומי.

ollama run hf.co/HauhauCS/Gemma4-31B-QAT-Uncensored-HauhauCS-Balanced-MTP:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון gemma של גוגל. הרישיון הזה מתיר שימוש מסחרי, אבל הוא כפוף למדיניות השימוש המקורית של גוגל ולמגבלות חלוקה מוגדרות. אם אתם מתכננים לשלב אותו במוצר מסחרי, אתם עדיין מחויבים לציית לתנאי השימוש הבסיסיים של משפחת ג'מה, גם בגרסה שעברה שינוי להסרת הסירובים.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗