GPT
G

gemma-3-12b-it-heretic-v2

קוד פתוח

DreamFastgemma2026-03-10

  • transformers
  • safetensors
  • gguf
  • gemma3
  • image-text-to-text

גרסה שעברה הסרת סירובים עבור Gemma 3 בגודל 12B. היא מיועדת בעיקר למי שמשתמש במודל כמקודד טקסט למחולל הווידאו LTX-2 בתוך ComfyUI ורוצה למנוע צנזורה על פרומפטים יצירתיים.

  • 12Bפרמטרים
  • 131,072טוקנים בהקשר
  • 175 GBמשקל הקבצים
  • 20,351הורדות בחודש

מה זה

מדובר בעיבוד של Gemma 3 12B IT באמצעות כלי בשם Heretic, שמטרתו להנמיך דרסטית את כמות הסירובים של המודל. במקום 100 סירובים מתוך 100 בדיקות במקור, הגרסה הזו נבחרה מתוך 200 ניסיונות כשהיא מסרבת רק ב־8 מקרים, עם סטיית KL נמוכה של 0.0801 שמצביעה על פגיעה מינימלית ביכולות הכלליות.

המודל מגיע עם שלל גרסאות מכווצות שמותאמות במיוחד לסביבת ComfyUI, כולל שימור משקלי הראייה לצורך שיפור פרומפטים מתמונה לווידאו. הכיווץ כאן לא נעשה בצורה עיוורת אלא בעזרת אופטימיזציה שמכוונת על ידי פירוק SVD כדי להקטין עיוותים במשקלים.

מתאים ל

  • קידוד טקסט למחוללי וידאו

    הזרמת פרומפטים מורכבים ב־LTX-2 בלי סירובים שמרככים את הייצוג הוויזואלי.

  • העשרת פרומפטים מתמונה

    קבצי ה־safetensors שומרים על משקלי הראייה הנדרשים ל־Image-to-Video.

  • הסקה מקומית עם llama.cpp

    קובץ ה־Q4_K_M מאפשר הרצה מהירה של שיחה על כרטיסי מסך ביתיים.

איפה זה נופל

הורדת הסירובים לא מייצרת ידע יש מאין. אם גוגל לא אימנה את ג'מה המקורית על תכנים מסוימים, המודל פשוט לא ידע אותם גם אם הוא כבר לא מסרב לענות. בנוסף, מודל הווידאו LTX-2 אומן מראש על הפיזור של ג'מה הרגילה, והעובדה שרוב השינוי התבצע בשכבה 48 בזמן ש־LTX-2 ממצע את כל השכבות אומרת שההשפעה על הווידאו הסופי עשויה להיות מוגבלת מאוד בפועל.

אותה משפחה

gemma-3-12b-it-heretic יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יפתור לחלוטין סירובים בהרצת פרומפטים?

לא. הכרטיס מראה שהמודל עדיין מסרב ב־8 מתוך 100 מקרים. מעבר לכך, אם המושג לא הופיע באימון המקורי, המודל לא יסרב אלא פשוט יפגין חוסר ידע.

האם גרסאות ה־GGUF כוללות יכולות ראייה?

לא, קבצי ה־GGUF מיועדים לעיבוד טקסט בלבד. אם יש לכם צורך בעיבוד תמונה לווידאו בתוך ComfyUI, חובה להשתמש באחד מקבצי ה־safetensors שכוללים את רכיב הראייה.

איך מריצים

בפורמט המקורי המלא נדרשים 23GB של זיכרון גרפי, אבל קיימות גרסאות מכווצות שמתאימות לחומרה מודרנית רגילה. גרסת INT8 שוקלת 13GB ועובדת היטב על כל כרטיס סביר מארכיטקטורת Ampere ומעלה, בעוד גרסאות ה־4 ביט יורדות לכיוון 7.7GB. למי שרוצה להריץ טקסט בלבד ב־llama.cpp, קובץ ה־GGUF ברמת Q4_K_M דורש רק 6.8GB של זיכרון ויספיק לרוב המחשבים.

אם אתם משתמשים בכרטיסי Blackwell חדשים, יש תמיכה מובנית בפורמטים כמו NVFP4 או MXFP8 שמנצלים את ליבות החומרה שלהם. אם המטרה היא סתם צ'אט כללי ולא חיבור מקומי ישיר לתהליכי וידאו ב־ComfyUI, עדיף להשתמש ב־API מרוחק של מודל גדול בהרבה במקום לתחזק את הקבצים האלה מקומית.

ollama run hf.co/DreamFast/gemma-3-12b-it-heretic-v2:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט כפוף לרישיון הרשמי של Gemma מבית גוגל. מותר להשתמש בו לצרכים מסחריים כל עוד עומדים בתנאי השימוש המקוריים של גוגל ומדיניות השימוש המקובל שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗