GPT
G

Gemma-4-31B-JANG_4M-CRACK-GGUF

קוד פתוח

douyamvgemma2026-04-06

  • gguf
  • gemma4
  • quantized
  • 31b
  • text-generation

גרסת GGUF שעברה הסרת מגבלות סירוב למודל של גוגל עם 31 מיליארד פרמטרים. פתרון מיועד למי שרוצה להריץ אותו מקומית בתוכנות רגילות בלי צנזורות ובלי תלות בפורמט MLX ייעודי.

  • 62.0 GBמשקל הקבצים
  • 8,113הורדות בחודש
  • 240לייקים

מה זה

הפרויקט הזה לוקח את המודל הבסיסי של גוגל, שעבר שילוב של הסרת מנגנוני סירוב ודחיסה מיוחדת, וממיר אותו לפורמט GGUF שמתאים לכלים נפוצים כמו llama.cpp, Ollama או LM Studio. המקור נבנה בפורמט של אפל שדרש כלי ספציפי מאוד ולא עבד באף מנוע הרצה סטנדרטי. כאן פתחו את המשקלים חזרה לקובצי ביניים ודחסו מחדש, כדי שתוכלו לטעון אותם בכל סביבה רגילה.

הארכיטקטורה עצמה כוללת 31 מיליארד פרמטרים בשישים שכבות, עם שילוב של מנגנוני קשב מקומיים וגלובליים ותמיכה במולטימודליות לתמונה ושמע לפי התיעוד המקורי. מה ששונה כאן זו הסרת מנגנוני הסירוב, מה שאומר שהוא יענה ישירות על פרומפטים שבמקור היו נחסמים על ידי גוגל.

מתאים ל

  • עבודה מקומית ללא חסימות

    הרצה מקומית מלאה לניסוח תשובות על נושאים שמודלים מסחריים נוטים לחסום אוטומטית עקב מדיניות סירוב נוקשה.

  • פיתוח עם כלי GGUF

    שילוב בסביבות עבודה מבוססות Ollama או llama.cpp בלי להיקשר לתוכנות בלעדיות של מחשבי מק.

  • מחקר על מודלים שעברו פריצה

    בדיקת ההתנהגות והדיוק של מודל גדול שעבר פריצת סירובים ודחיסה כפולה מול גרסת המקור הנקייה.

איפה זה נופל

הבעיה המרכזית בתהליך היא איבוד איכות כפול. המודל המקורי כבר היה דחוס לממוצע של 5.1 ביט, והיוצר פתח אותו לפורמט ביניים ודחס שוב, מה שיוצר קירוב ולא שחזור מדויק. בנוסף, הסרת מעצורי הבטיחות והסירובים הופכת את הפלטים שלו לחשופים להזיות ולתכנים בעייתיים, ואין כאן שום אחריות על מה שייפלט. הנתונים מתועדים באנגלית בלבד, כך שלא כדאי לבנות עליו לעברית בלי בדיקה מקיפה מראש.

שאלות
נפוצות

האם הדחיסה הכפולה פגעה בביצועים של המודל?

היוצר מציין שהנזק מינימלי בגלל ששכבות הקשב נשמרו ב־8 ביט במקור, אבל פתיחה של מודל דחוס ודחיסתו מחדש היא בהכרח קירוב מתמטי ולא מקור מדויק. בגרסאות הנמוכות כמו Q3 תרגישו ירידה מורגשת יותר באיכות הטקסט.

איזו גרסה מומלץ להוריד מתוך הרשימה?

גרסת Q4_K_M נותנת את היחס המאוזן ביותר בין משקל של כ־18 גיגה לביצועים סבירים, ודורשת מחשב עם 24 עד 32 גיגה בייט זיכרון. אם המערכת שלכם חזקה יותר, עדיף לכוון ל־Q5_K_M כדי לשמור על איכות גבוהה יותר.

איך מריצים

טעינת הקבצים עובדת ישירות דרך llama.cpp, פקודת יצירה בתוך Ollama או פתיחה רגילה בתוכנת LM Studio. בשביל להריץ גרסה שמישה כמו Q4_K_M ששוקלת 18 גיגה בייט, תצטרכו לפחות 24 גיגה זיכרון פנוי, כשההמלצה היא 32 גיגה בייט כדי לעבוד בנוחות.

הגרסאות נעות בין Q3_K_M המינימלית שתופסת 14 גיגה ועד Q8_0 שדורשת מעל 40 גיגה בייט זיכרון. אם אין לכם כרטיס מסך חזק או מספיק זיכרון אחוד במחשב, עדיף להשתמש בפתרון ענן או ב־API חיצוני, כי המודל הזה כבד מדי למחשבים ניידים סטנדרטיים.

ollama run hf.co/douyamv/Gemma-4-31B-JANG_4M-CRACK-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מפורסם תחת תנאי הרישיון של גוגל עבור משפחת ג'מה. הרישיון דורש שימוש בהתאם למדיניות השימוש המקורית ולחוקים החלים, אך הוא כולל תנאים והגבלות ספציפיים שחובה לקרוא לעומק לפני שילוב שלו במוצר מסחרי, בייחוד כשמדובר בגרסה שעברה שינוי של מנגנוני הבטיחות.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗