GPT
G

gemma-4-12B-coder-fable5-composer2.5-v1-uncensored-heretic-GGUF

קוד פתוח

llmfan46apache-2.02026-06-21

  • transformers
  • gguf
  • gemma4
  • coding
  • code

גרסת קוד מקומית של Gemma 4 12B שעברה הסרת מגבלות וסירובים. היא מיועדת למי שרוצה מודל פייתון שלא מתחמק מבקשות ורץ על חומרה ביתית.

  • 72.4 GBמשקל הקבצים
  • 6,279הורדות בחודש
  • 41לייקים

מה זה

מדובר במודל 12B שמבוסס על שילוב נתוני חשיבה מ־Composer 2.5 ו־Fable 5, שעבר תהליך הסרת סירובים באמצעות כלי בשם Heretic בשיטת MPOA. המטרה כאן הייתה לנקות את מנגנוני הבטיחות הרגילים של גוגל בלי לחרב את יכולת ההסקה הכללית. לפי המדידות בכרטיס, שיעור הסירובים צנח מ־100 מתוך 100 ל־9 מתוך 100 בלבד.

במבחן הידע MMLU הציון ירד מ־75.72% במקור ל־75.15%, ומרחק ה־KL נמדד ב־0.0467. המשמעות בפועל היא שההתערבות במשקולות כמעט לא פגעה בידע הכללי של המודל. בנוסף, חלון ההקשר תוקן בחזרה ל־256K טוקנים במקום באג ה־131K שהיה במקור.

מתאים ל

  • פיתוח פייתון מקומי

    כתיבה ובדיקה של פונקציות ואלגוריתמים ישירות על המחשב, בלי תלות ברשת ובלי מנגנוני צנזורה.

  • מחקר אבטחת מידע

    ניתוח חולשות ובדיקות חדירה בקוד, במצבים שבהם מודלים רגילים מסרבים לשתף פעולה עם הבקשה.

  • עבודה עם הקשר רחב

    הזנת קבצי קוד ארוכים לתוך חלון של 256K טוקנים על גבי חומרה עם זיכרון מאוחד או כרטיס חזק.

איפה זה נופל

המודל ממוקד כמעט לחלוטין בפייתון ובקוד אלגוריתמי, ולכן במשימות שפה כלליות או תכנות מורכב בשפות אחרות הוא פחות מדויק. מבחני ה־MMLU מראים נפילות מורגשות בתחומים כמו מתמטיקה לתיכון (36.22%) וכימיה למכללות (38.3%). מאחר שהוסרו ממנו מנגנוני הבטיחות, הוא יפלוט קוד מסוכן או שגוי בלי להזהיר, וצריך להריץ אותו רק בסביבה מבודדת.

שאלות
נפוצות

איך משפיעה הסרת הסירובים על איכות התשובות?

השינוי מתמקד במנגנוני הסירוב ולא בידע הבסיסי. מדד ה־MMLU ירד בפחות מאחוז אחד, כך שהיכולת שלו לפתור בעיות נשארה כמעט זהה למודל הבסיס.

האם המודל מתאים לשימוש ישיר מול לקוחות?

לא מומלץ בלי שכבת סינון עצמאית. המודל פולט כל מה שמבקשים ממנו ולא כולל גידור בטיחותי, ולכן הוא מתאים בעיקר לסביבת פיתוח פנימית.

איך מריצים

הקבצים מגיעים בפורמט GGUF ומיועדים לכלים כמו llama.cpp, LM Studio או Ollama. גרסת Q4_K_M שוקלת 6.87 GB ונחשבת לאיזון הנכון לרוב המשתמשים, כאשר אפשר להריץ אותה כבר על כרטיס עם 8 GB של זיכרון מסך בחלונות הקשר קצרים של 2K עד 4K.

אם אתם צריכים לנצל את מלוא ההקשר של 256K, תצטרכו כרטיס עם 32 GB זיכרון או מעבר ל־KV cache של q4_0. שימו לב שהמודל דורש גרסה עדכנית של llama.cpp שתומכת בארכיטקטורת gemma4_unified, ושיש קובץ פרוז'קטור נפרד אם אתם בונים על יכולות ראייה.

ollama run hf.co/llmfan46/gemma-4-12B-coder-fable5-composer2.5-v1-uncensored-heretic-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו הלאה בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗