GPT
M

mlabonne_gemma-3-27b-it-abliterated-GGUF

קוד פתוח

bartowskigemma2025-03-17

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • imatrix
  • conversational

גרסה מכווצת של Gemma 3 בגודל 27 מיליארד פרמטרים שעברה הסרת מנגנוני סירוב. היא פונה למי שמחפש מודל ויז'ואלי וטקסטואלי חזק שמגיב ישירות בלי לחנך את המשתמש.

  • 408 GBמשקל הקבצים
  • 5,775הורדות בחודש
  • 47לייקים

מה זה

מדובר בהמרה של bartowski לפורמט GGUF עבור llama.cpp, המבוססת על המודל של mlabonne. המודל שייך לקטגוריית image-text-to-text, כך שהוא מקבל גם קלט תמונה לצד טקסט. התהליך המרכזי שבוצע במקור הוא אבלטרציה, כלומר נטרול של וקטורי הסירוב המובנים במודל הבסיס כדי למנוע ממנו לסרב לבקשות שלכם.

המשקלים מגיעים מכווצים בשיטת imatrix, שנעזרת בדאטה־סט כיול כדי למזער את אובדן הדיוק במעבר מפורמט BF16 המקורי. כדי להשתמש ביכולות עיבוד התמונה יש להוריד קובץ מקרן ייעודי בשם mmproj, הזמין בגרסאות F16 או F32, בנפרד מקובץ הטקסט הראשי.

מתאים ל

  • ניתוח תמונות ללא חסימות

    מאפשר תיאור והבנת תמונות חופשית דרך קובץ mmproj בלי לקבל הודעות סירוב גנריות מהמערכת.

  • הרצה מקומית על 24GB VRAM

    גרסת Q4_K_M במשקל 16.55GB מתאימה בדיוק לכרטיסי מסך צרכניים חזקים לעבודה מהירה ללא תלות ברשת.

  • מחקר אבטחה ובדיקות חוסן

    אידיאלי לבדיקת תרחישי קצה והתנהגות מודלי שפה שבהם מנגנוני ההגנה הרגילים מפריעים לבדיקה.

איפה זה נופל

ההסרה של מנגנוני הסירוב לא הופכת את המודל לחכם יותר. היא רק מסירה את הבלמים שלו, מה שאומר שהוא יספק תשובות שגויות או רעילות באותו ביטחון שבו הוא עונה על שאלות רגילות. בנוסף, גרסאות הדילול האגרסיביות ביותר, במיוחד מתחת ל־Q3, פוגעות ביכולת ההסקה ומייצרות טעויות גסות. אם אתם צריכים ניתוח תמונה, חובה לטעון את קובץ ה־mmproj המתאים, אחרת יכולת הראייה פשוט לא תעבוד.

שאלות
נפוצות

חייבים להוריד את כל הקבצים שבעמוד?

ממש לא, מורידים רק קובץ GGUF אחד ברמת הדילול שמתאימה לזיכרון שלכם. אם אתם רוצים תמיכה בתמונות, מורידים בנוסף רק קובץ mmproj אחד בגודל F16 או F32.

מה ההבדל בין גרסאות K לגרסאות I?

גרסאות K הן הפורמט הוותיק והסטנדרטי שעובד בכל מקום. גרסאות I משתמשות בשיטות חדשות שנותנות איכות טובה יותר במשקלים נמוכים, אבל הן איטיות יותר על מעבד ולא תואמות ל־Vulkan.

איך המודל הזה מתמודד עם עברית?

הכרטיס לא מציין מבחני ביצועים בעברית ולכן אין נתונים רשמיים לגביה. תצטרכו לבדוק בעצמכם על קלט אמיתי אם רמת השפה והתרגום מספקות את הצרכים שלכם.

איך מריצים

כדי להריץ אותו מקומית צריך לבחור קובץ יחיד מתוך עשרות גרסאות הדילול הזמינות. הגרסאות המומלצות כמו Q4_K_M שוקלות סביב 16.55GB, מה שדורש כרטיס מסך עם לפחות 24GB זיכרון כדי להריץ הכל על ה־VRAM במהירות סבירה יחד עם ההקשר וקובץ ה־mmproj. אם יש לכם פחות מזה, תצטרכו לרדת לגרסאות נמוכות כמו IQ3 או Q2_K, שמתחילות מ־8.44GB, או לחלק את העומס עם ה־RAM של המעבד במחיר של איטיות מורגשת.

ההרצה מתבצעת ישירות דרך llama.cpp מגרסה b4896 ומעלה או דרך LM Studio. שימו לב שגרסאות מסוג I-quant לא עובדות עם Vulkan, כך שמשתמשי AMD צריכים לוודא שיש להם בילד שתומך ב־rocBLAS. מי שאין לו חומרה מתאימה ורוצה לקבל תוצאות מהר בלי להחזיק שרת יקר פשוט ישתמש ב־API חיצוני.

ollama run hf.co/bartowski/mlabonne_gemma-3-27b-it-abliterated-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

32 קבצים במאגר, 408 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הרשמי המדווח הוא gemma. זהו הרישיון המקורי של גוגל למשפחה הזו, שמאפשר שימוש ומחקר אך כפוף לתנאי השימוש ולהגבלות הפצה מסחריות מוגדרות מראש. צריך לקרוא היטב את תנאי הרישיון של גוגל לפני שמשלבים אותו במוצר שמיועד ללקוחות.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗