GPT
G

gemma-4-12b-it-uncensored-GGUF

קוד פתוח

zaakiriogemma2026-06-04

  • gguf
  • llama.cpp
  • gemma
  • gemma4
  • heretic

גרסה מקומית ונטולת חסימות של המודל מבית גוגל, שמשלבת טקסט, תמונה ושמע בקובץ אחד. היא עונה על בקשות שהמקור מסרב להן ומיועדת להרצה חופשית בתוכנת llama.cpp.

  • 75.2 GBמשקל הקבצים
  • 33,318הורדות בחודש
  • 63לייקים

מה זה

מדובר בהמרה לפורמט GGUF של גרסה שעברה תהליך הסרת סירובים באמצעות כלי בשם Heretic על גבי הדגם המקורי של גוגל. המבנה הוא מודל פענוח יחיד שקולט ישירות טקסט, תמונות ואודיו, עם חלון הקשר של עד 256 אלף טוקנים. השינויים במשקולות נעשו רק בשכבות השפה, כך שהיכולות הרב מודליות נשארו ללא שינוי מהמקור.

במבחן של מאה פרומפטים בעייתיים, כמות הסירובים צנחה מ־99 במקור ל־23 בגרסה הזו. סטיית ה־KL על פרומפטים רגילים עומדת על 0.043, מה שאומר שהיכולות הכלליות נשמרו כמעט במלואן. עם זאת, מדד הסירובים מבוסס על זיהוי מילים פשוט שנוטה לסמן גם תשובות שכוללות אזהרה כסירוב, כך שבפועל הוא עשוי לענות אפילו יותר.

מתאים ל

  • תמלול וניתוח קול מקומי

    קולט קובצי אודיו בפורמט wav ישירות מהמחשב ומנתח אותם ללא שליחה לשרת חיצוני.

  • בדיקות אבטחה ומחקר

    מאפשר לבחון שאילתות מחקר ללא מנגנון הסירוב האוטומטי שקיים במודל המסחרי.

  • ניתוח מסמכים ארוכים

    תומך בחלון הקשר של עד 256 אלף טוקנים שמאפשר עיבוד טקסטים גדולים מאוד בהרצה אחת.

איפה זה נופל

קליטת האודיו מוגדרת בתוכנה כניסיונית, כך שאיכות התמלול עלולה לרדת ולא מתאימה למשימות קריטיות. וידאו לא נתמך ישירות אלא דורש מהקוד שלכם לפרק את הקובץ לתמונות בודדות מראש. בנוסף, הסרת הסירובים אומרת שהמודל פולט תכנים שגוגל חסמה במקור, ואין עליו מנגנוני הגנה מובנים.

שאלות
נפוצות

האם המודל דורש כרטיס מסך חזק כדי לעבוד?

לא בהכרח. גרסת ה־4 ביט המומלצת שוקלת פחות משבעה גיגה בייט, כך שהיא רצה בצורה חלקה על מחשבי מק או כרטיסי מסך ביתיים פשוטים.

האם צריך להפעיל את קובץ ה־MTP להאצת הריצה?

בכרטיסי מסך של NVIDIA מומלץ מאוד להפעיל אותו כדי לקבל מהירות כפולה. במחשבי מק עם מעבדי אפל הוא דווקא מאט את הביצועים בחצי ועדיף לוותר עליו.

למה צריך קובץ נוסף כדי להעלות תמונות?

חלוקת המשקולות בפורמט הזה מפרידה בין המוח הטקסטואלי לבין המקרן הרב מודלי. בלי לצרף את קובץ ה־mmproj בהפעלה, התוכנה תדחה קובצי מדיה.

איך מריצים

הקבצים רצים ישירות דרך llama.cpp, כשהגרסה המומלצת למרבית השימושים היא Q4_K_M ששוקלת 6.87 גיגה בייט ונכנסת בקלות למעבדים גרפיים ביתיים או זיכרון אחוד. מדרגות הכיווץ נעות מגרסת Q2_K הזעירה בנפח 4.50 גיגה בייט ועד קובץ f16 מלא ששוקל 22.20 גיגה בייט. בשביל קלט תמונה או קול, חובה לטעון לצד המודל קובץ מקרן נפרד בשם mmproj ששוקל 0.16 גיגה בייט.

יש אפשרות להוסיף מודל מנחש קטן להאצת יצירת הטקסט. בכרטיסי מסך של NVIDIA זה מכפיל את המהירות, אבל במחשבי אפל עם מעבדי סיליקון זה גורם להאטה של פי שניים, מקצב של 27 טוקנים לשנייה ל־12 בלבד, ולכן במק צריך לכבות את האפשרות הזו.

ollama run hf.co/zaakirio/gemma-4-12b-it-uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף לרישיון gemma של גוגל שממשיך לחול על הנגזרת הזו, ודורש ציות לחוק ולתנאי השימוש המקוריים שלו. אתם אחראים בלעדית לתוצרים ולתוכן שהמודל פולט.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗