GPT
G

gemma-2-2b-it-abliterated-GGUF

קוד פתוח

bartowskigemma2024-08-01

  • gguf
  • text-generation
  • en
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת של Gemma 2 2B שעברה הסרת מנגנוני סירוב, ורצה מקומית על מעבדים חלשים בלי לצנזר תשובות.

  • 33.8 GBמשקל הקבצים
  • 40,743הורדות בחודש
  • 88לייקים

מה זה

מדובר במודל שפה קומפקטי שמבוסס על הגרסה של IlyaGusev ל־Gemma 2 של גוגל, ועבר המרה של משקולות בשיטת imatrix על ידי bartowski. המטרה העיקרית שלו היא להחזיר תשובות ישירות בלי מנגנוני הבטיחות הרגילים שמסרבים לבקשות מסוימות. הוא מתמקד ביצירת טקסט באנגלית, והיתרון הגדול שלו הוא שילוב בין גודל זעיר לביצועים סבירים במשימות בסיסיות.

המשקולות המקוריות כווצו לפורמט GGUF בעזרת llama.cpp, מה שמאפשר לו לרוץ על כמעט כל מחשב קיים. בניגוד למודלים מלאים שדורשים חומרה מקצועית, הגרסאות כאן תופסות בין 1.37 ל־2.78 גיגה בייט בלבד בכימותים המעשיים, כך שהוא נכנס בקלות לזיכרון של כרטיסי מסך בסיסיים ואפילו לזיכרון עבודה רגיל. זה פתרון יעיל למי שמחפש מודל קל שלא נחסם על כל ניסוח, אבל לא הייתי בונה עליו כבסיס ללוגיקה מורכבת.

מתאים ל

  • עיבוד מקומי במחשב נייד

    רץ ישירות על מעבד ודורש פחות משני גיגה בייט זיכרון, מושלם לניסויים מקומיים בלי תלות ברשת.

  • מענה טקסטואלי ללא סירובים

    מספק תשובות ישירות לבקשות שמודלים רגילים נוטים לחסום בגלל מנגנוני סינון מחמירים מדי.

  • סיווג טקסטים קצרים באנגלית

    משקל זעיר שמאפשר תגובה מהירה במשימות ניסוח, מיון וסיכום פשוטות באנגלית.

איפה זה נופל

הבעיה המרכזית שלו היא היעדר תמיכה ב־System prompt. הפורמט דורש תבנית פנייה קשיחה של משתמש ומודל בלבד, כך שאי אפשר להגדיר לו דמות או הנחיות קבועות מראש בצורה מקובלת. בנוסף, המודל מאומן רשמית באנגלית בלבד. אם תפנו אליו בעברית אתם צפויים להזיות, תחביר שבור ותשובות ברמה נמוכה. מודל של שני מיליארד פרמטרים גם סובל מאי דיוקים עובדתיים רבים ולא מסוגל להתמודד עם הנחיות ארוכות ומסובכות.

שאלות
נפוצות

האם אפשר להשתמש בו בתוך יישום עם System prompt?

לא. כרטיס המודל מציין מפורשות שהוא לא תומך ב־System prompt. יש לעבוד בדיוק לפי תבנית ה־turn שמחליפה תורות של משתמש ומודל בלבד, אחרת התוצאות ישתבשו.

איזה קובץ הכי כדאי להוריד למחשב ממוצע?

עבור רוב המקרים קובץ Q4_K_M במשקל 1.71 גיגה בייט נותן את האיזון הטוב ביותר בין ביצועים לצריכת זיכרון. אם יש לכם מספיק VRAM פנוי, עדיף להוריד את Q6_K ששוקל 2.15 גיגה בייט.

איך מריצים

את המודל מריצים ישירות באמצעות llama.cpp או דרך ממשקים גרפיים כמו LM Studio. מורידים רק קובץ אחד מתוך הרשימה, לפי כמות הזיכרון שיש לכם. קובץ Q4_K_M שוקל 1.71 גיגה בייט ומתאים לרוב המשתמשים, בעוד ש־Q6_K שוקל 2.15 גיגה בייט ומספק איכות גבוהה יותר. כדי לקבל מהירות מרבית, עדיף לבחור קובץ שקטן בגיגה או שניים מנפח ה־VRAM של כרטיס המסך שלכם.

אם אתם על מעבד בלבד או כרטיס גרפי ישן, גרסאות ה־I-quants כמו IQ4_XS יתנו יחס טוב בין גודל לאיכות, אם כי הן איטיות יותר על Vulcan או Apple Metal. מי שצריך תוצאות ברמה גבוהה או ניתוח מעמיק יעשה בשכל אם ישתמש ב־API של מודלים גדולים, כי מודל 2B מוגבל מטבעו.

ollama run hf.co/bartowski/gemma-2-2b-it-abliterated-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל כפוף לרישיון gemma של גוגל, יחד עם השינויים של גרסת ה־abliterated. הרישיון המקורי של גוגל מתיר שימוש מסחרי תחת תנאים ומגבלות שימוש הוגן, אך הוא כולל מדיניות שימוש מחייבת. הסרת מנגנוני הבטיחות עשויה להתנגש עם תנאי השימוש המקוריים, ולכן הטמעה שלו במוצר מסחרי דורשת בדיקה משפטית זהירה של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗