GPT
G

Gemma-4-E4B-Uncensored-HauhauCS-Aggressive

קוד פתוח

HauhauCSgemma2026-04-02

  • gguf
  • uncensored
  • gemma4
  • abliterated
  • vision

גרסה נטולת סירובים של מודל המולטימודל הקטן של גוגל. אתם מקבלים עיבוד תמונה וטקסט בנפח של 4 מיליארד פרמטרים, בלי מעצורי בטיחות שמפסיקים תשובות באמצע.

  • 57.4 GBמשקל הקבצים
  • 2,541,225הורדות בחודש
  • 1,134לייקים

מה זה

מדובר בהתאמה אגרסיבית של מודל הבסיס של גוגל, שנועדה למחוק לגמרי מנגנוני סירוב לפרומפטים. המודל מתמודד עם טקסט ותמונה באופן מובנה, ומחזיק חלון הקשר של 131 אלף טוקנים על פני 42 שכבות. התשתית משלבת חלונות תשומת לב גולשים של 512 טוקנים עם תשומת לב מלאה, ומשתמשת ב־18 שכבות KV משותפות כדי לחסוך בזיכרון.

המפתח בדק את השינוי מול 465 פרומפטים שונים וקיבל אפס סירובים. במקום לסרב לענות, המודל עשוי להדביק פה ושם הערת אזהרה קצרה שהוטמעה כבר באימון הראשוני של גוגל, אבל הוא מייצר את כל התוכן שביקשתם עד הסוף בלי לעצור באמצע.

מתאים ל

  • ניתוח תמונות ללא חסימות

    מאפשר לפענח תמונות עם קובץ ה־mmproj בלי שמנגנוני בטיחות יסרבו לעבד פרטים חריגים.

  • עיבוד טקסט בחומרה צנועה

    משקל של 5 גיגה בייט בקוונט בינוני מאפשר להריץ מודל שלם על כרטיס מסך ביתי בודד.

  • עבודה עם מסמכים ארוכים

    תמיכה בחלון הקשר של 131 אלף טוקנים מאפשרת להזין קבצים ומסמכים מלאים לתוך הפרומפט.

איפה זה נופל

גוגל הטמיעה במודל הזה מנגנוני ביקורת פנימיים שפועלים כמו מודלי תגמול גנרטיביים, ולכן הסרת החסימות מורכבת יותר. המפתח מודה בעצמו שהמודל לא עבר מספיק בדיקות ידניות בהקשרים ארוכים. המשמעות היא שבהקשרים עמוקים ייתכנו מקרים חריגים שבהם המודל יפלוט אזהרות מובנות, או יתנהג בצורה לא יציבה שלא נצפתה במבחנים קצרים.

שאלות
נפוצות

איזו גרסת קוונטיזציה עדיף להוריד למחשב מקומי?

עבור כרטיס מסך עם 8 גיגה בייט זיכרון, גרסת Q4_K_P בגודל 5.1 גיגה בייט או Q4_K_M בגודל 5.0 גיגה בייט נותנות איזון טוב. הן משתמשות במטריצת חשיבות כדי לשמור על איכות המודל, ומשאירות מספיק זיכרון לחלון ההקשר. אם אתם צריכים תמיכה בתמונות, קחו בחשבון עוד 945 מגה בייט לקובץ הנלווה.

למה המודל עדיין מוסיף אזהרות לתשובות?

השינוי של HauhauCS ביטל את הסירוב לייצר טקסט, אבל בחלק מהמקרים נשארות אזהרות קצרות שהוטמעו עמוק במשקולות של גוגל. המודל ייצר את כל המידע שביקשתם ולא יעצור, אך לעיתים יצמיד הערה בסוף או בהתחלה.

איך מריצים

הקבצים מופצים בפורמט GGUF, כך שאפשר להריץ אותם ישירות דרך סביבות עבודה כמו llama.cpp או LM Studio. גרסאות הקוונטיזציה נעות בין 4.2 גיגה בייט בגרסת Q2_K_P ועד 7.6 גיגה בייט בקובץ Q8_K_P. רוב המשתמשים יסתדרו מצוין עם Q4_K_M ששוקל 5.0 גיגה בייט, או גרסת Q4_K_P שמוסיפה דיוק בגודל 5.1 גיגה בייט. כרטיס מסך בסיסי עם 8 גיגה בייט זיכרון יספיק כדי לטעון את כל המודל לזיכרון הגרפי.

אם אתם צריכים לפענח תמונות או אודיו בנוסף לטקסט, חובה לטעון גם את קובץ ה־mmproj הנפרד ששוקל 945 מגה בייט. בהרצה ב־llama.cpp חייבים להוסיף את הדגל jinja כדי שתבנית השיחה תפעל כשורה, והגדרות היצירה המומלצות הן טמפרטורה 1.0, top_p של 0.95 ו־top_k של 64.

ollama run hf.co/HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא gemma. הרישיון הזה של גוגל מאפשר שימוש מסחרי, אך כפוף למדיניות השימוש והמגבלות של החברה. יש לבדוק את תנאי הרישיון המקוריים לפני שילוב המודל במוצר חי.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗