GPT
G

gemma-4-26B-A4B-it-uncensored-heretic-GGUF

קוד פתוח

llmfan46apache-2.02026-04-07

  • transformers
  • gguf
  • heretic
  • uncensored
  • decensored

גרסת קוונטיזציה של מודל מולטימודלי ממשפחת Gemma 4, שעבר תהליך הסרת צנזורה ומסרב להרבה פחות בקשות. הוא משלב ארכיטקטורת תערובת מומחים שרצה מהר יחסית לגודלו המלא.

  • 184 GBמשקל הקבצים
  • 9,799הורדות בחודש
  • 52לייקים

מה זה

מדובר במודל שמבוסס על Gemma 4 26B A4B של גוגל, שעבר התערבות במשקלים באמצעות כלי בשם Heretic כדי לצמצם חסימות וסירובים. לפי נתוני הבדיקה בכרטיס, שיעור הסירובים צנח מ־100 מתוך 100 במקור ל־11 מתוך 100 בגרסה הזו. המשמעות היא שהמודל עונה כמעט לכל הנחיה בלי לחנך או לסרב, תוך שמירה על מדד התבדרות KL של 0.0468 ביחס למקור.

המבנה שלו הוא תערובת מומחים עם 25.2 מיליארד פרמטרים בסך הכול, אבל רק 3.8 מיליארד מהם פעילים בכל טוקן. זה נותן לו מהירות תגובה שמזכירה מודל 4B קטן, לצד יכולות של מודל גדול יותר וחלון הקשר של 256 אלף טוקנים. הוא מקבל גם טקסט וגם תמונות, תומך במצב חשיבה פנימי, ומגיע מראש בפורמט GGUF שמתאים להרצה מקומית בכלים פופולריים.

מתאים ל

  • ניתוח מסמכים ותמונות

    קריאת תמונות ומסמכים סרוקים בפורמט מולטימודלי מקומי, בלי חשש מחסימות שווא על תוכן רגיש.

  • בוטים וסימולציות תוכן

    משחקי תפקידים ויצירת טקסט חופשי שבהם מודלים מסחריים רגילים מסרבים לשתף פעולה או קוטעים את השיחה.

  • מחקר ובדיקות חדירות

    בדיקת תרחישי אבטחה ושאילתות ישירות בתחומי משפט וטכנולוגיה ללא שכבת סינון תאגידית שמגבילה את הפלט.

איפה זה נופל

הסרת הצנזורה פגעה מעט ביכולות הכלליות. במבחן MMLU הדיוק ירד מ־82.48% במקור ל־80.81%, עם פגיעה בולטת יותר בתחומים כמו משפטים מקצועיים, שבהם הציון ירד מ־70.06% ל־64.46%, ותרחישים מוסריים שירדו מ־70.14% ל־63.57%. במבחן ההיגיון הפיזיקלי PIQA הירידה הייתה מתונה יותר, מ־92.06% ל־91.73%.

בנוסף, המודל אינו כולל תמיכה באודיו, בניגוד לדגמי E2B ו־E4B הקטנים יותר באותה משפחה. העובדה שהוא כמעט לא מסרב דורשת מכם לבנות שכבות הגנה עצמאיות אם אתם חושפים אותו למשתמשי קצה, כי הוא לא יעצור בעצמו תוכן בעייתי.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי אחד?

זה תלוי ברמת הדחיסה שתבחרו. קובץ ה־BF16 המלא שוקל המון ולא ייכנס לכרטיס ביתי, אבל גרסאות כמו Q4_K_M או Q3 ידרשו משמעותית פחות זיכרון ויאפשרו עבודה על חומרה צנועה יותר, כל עוד יש לכם מספיק RAM או VRAM להחזיק את כל 25.2 מיליארד הפרמטרים של המודל ברקע.

איך מפעילים את היכולת לניתוח תמונות ב־GGUF?

בשביל תמונות לא מספיק להוריד רק את קובץ המודל הראשי. אתם חייבים להוריד בנוסף את קובץ הפרויקטור gemma-4-26B-A4B-it-mmproj-BF16.gguf ולטעון אותו יחד עם המודל בכלי ההרצה שלכם, כמו llama.cpp או LM Studio, ולהקפיד לשים את התמונה לפני הטקסט בהנחיה.

מה המשמעות של מצב החשיבה ואיך שולטים בו?

המודל כולל יכולת חשיבה מובנית שמייצרת בלוק נימוקים לפני התשובה הסופית. מפעילים אותה על ידי הוספת הטוקן הייעודי בתחילת ה־system prompt, וכשרוצים תשובה מהירה בלי הנימוק הפנימי, מסירים את הטוקן והמודל פשוט מחזיר בלוק חשיבה ריק וממשיך מיד לתוצאה.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־184 גיגה-בייט, כי הוא מכיל מגוון רמות דחיסה, החל מ־BF16 מלא ועד Q3_K_M. אתם מורידים רק את קובץ ה־GGUF שמתאים לזיכרון שלכם, למשל Q4_K_M למחשבים עם כרטיס מסך מוגבל או Q8_0 לשמירה מקסימלית על דיוק. אם אתם מתכננים להזין תמונות, חובה להוריד גם את קובץ ה־Vision Projector בשם gemma-4-26B-A4B-it-mmproj-BF16.gguf ולהריץ אותו במקביל.

ההרצה עובדת דרך llama.cpp, LM Studio או Ollama. ארכיטקטורת MoE דורשת לטעון את כל המשקלים לזיכרון גם אם רק חלקם רצים בפועל, כך שכרטיס מסך ביתי בודד עם מעט VRAM יתקשה להחזיק גרסאות כבדות כמו Q8 או BF16.

ollama run hf.co/llmfan46/gemma-4-26B-A4B-it-uncensored-heretic-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, והפצה מחדש במוצרים סגורים, כל עוד שומרים על הודעות זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗