GPT
G

Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced

קוד פתוח

HauhauCSgemma2026-06-22

  • gguf
  • uncensored
  • gemma4
  • vision
  • multimodal

גרסה נטולת סירובים למודל 12B שכוללת עיבוד תמונה ותמיכה בהאצת יצירת טקסט. היא מתאימה למי שרוצה קוד סוכני או חשיבה חופשית בלי מעצורי בטיחות שמכשילים את הריצה.

  • 7.3 GBמשקל הקבצים
  • 445,413הורדות בחודש
  • 339לייקים

מה זה

מדובר בהסבה של המודל המקורי שנועדה לאפס לחלוטין את מנגנוני הסירוב שלו, תוך שמירה מלאה על היכולות המקוריות בלי שינוי של מערכי הנתונים. המפתח מדווח על אפס סירובים מתוך 465 בדיקות שנערכו, כך שהוא לא מסרב להוראות ישירות. הגרסה הזו נבנתה ישירות ממשקולות שעברו אימון מודע לכימות, ולכן היא מגיעה ברמת דיוק של 4 ביט בלי איבוד איכות מורגש לעומת הדיוק המקורי.

בנוסף לטקסט ולחלון הקשר של 256K, החבילה מגיעה עם ראש ייעודי לחיזוי מרובה טוקנים שמאפשר פענוח ספקולטיבי. לפי נתוני המפתח, השימוש ברכיב הזה מאיץ את מהירות הפליטה בערך בשישים אחוזים בהרצה דרך llama.cpp, כיוון שהמודל בודק כל טוקן שנחזה ושומר על פלט זהה לחלוטין.

מתאים ל

  • סוכני פיתוח קוד

    הוא מתוכנן לפעול בלי לסרב להוראות אוטומטיות, מה שמונע תקיעה של תהליכי עבודה אוטונומיים.

  • ניתוח תמונות והסקה

    שילוב קובץ הראייה מאפשר עיבוד תמונות לצד טקסט בלי מעצורים מלאכותיים על תוכן הקלט.

  • כתיבה חופשית וסיפורית

    ההתאמה של גרסת Balanced שומרת על עקיבה הדוקה אחרי הנחיות יצירתיות מורכבות ללא צנזורה.

איפה זה נופל

המפתח מציין שבמקרים חריגים מסוימים המודל עדיין עשוי להתחמק במענה הראשון, ודורש ניסוח מחדש או מסגור שונה כדי לענות. המודל מתועד לשפה האנגלית בלבד ולא נבדק לעברית, כך שלא כדאי לבנות עליו לעיבוד שפה מקומית. בנוסף, מי שבונה על פריסה מרובת כרטיסים עלול להיתקל בקריסות תוכנה בהגדרות מסוימות, והסרת הסירובים דורשת בדיקה קפדנית לפני שמשלבים אותו במערכת שפונה למשתמשי קצה ללא פיקוח.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב בלי כרטיס מסך חזק?

המודל שוקל סביב 7.3 גיגהבייט בקבצי GGUF בכימות 4 ביט. אפשר תיאורטית להריץ אותו על מעבד מרכזי וזיכרון מערכת, אבל התגובה תהיה איטית משמעותית, במיוחד אם מפעילים חלון הקשר גדול או קלט תמונה.

איך מפעילים את מהירות היצירה המוגברת?

טוענים את קובץ המודל יחד עם קובץ ההאצה הייעודי בפקודת ההרצה של llama.cpp. ראש החיזוי מייצר טוקנים מראש והמודל מאמת אותם, מה שמספק תוספת ביצועים של כשישים אחוז בלי לפגוע באיכות הפלט.

איך מריצים

המשקל הכולל של הקבצים עומד על כמעט שבעה וחצי גיגהבייט בפורמט GGUF, מה שאומר שכרטיס מסך ביתי יחיד עם 12 או 16 גיגהבייט זיכרון יחזיק את המודל, את רכיב הראייה ואת ראש ההאצה בשלמותם. מריצים אותו ישירות בתוכנות כמו llama.cpp או LM Studio, ומומלץ לקבוע פרמטרים ייעודיים שהוגדרו עבורו: טמפרטורה של 0.6, top_k על 64, וקנס חזרתיות של 1.1.

אם סביבת העבודה שלכם נשענת על LM Studio עם מספר כרטיסי מסך, שימו לב שמצב חלוקת טנזורים נוטה לקרוס עם המודל הזה. עדיף להגדיר כרטיס בודד או חלוקת שכבות. אם אין לכם חומרה מקומית מתאימה לטעינת כל המשקלים בזיכרון הגרפי, עדיף להשתמש בפתרון ענן מרוחק.

ollama run hf.co/HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא רישיון gemma. הרישיון הזה מתיר שימוש מסחרי ומחקר תחת תנאי השימוש וההגבלות של גוגל, אך אינו רישיון קוד פתוח חופשי לחלוטין כמו MIT או Apache. אם אתם משלבים אותו במוצר מסחרי, עליכם לוודא שהשימוש שלכם תואם למדיניות השימוש של משפחת דגמי גמה.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗