GPT
G

gemma-2-9b-it-abliterated-GGUF

קוד פתוח

bartowskigemma2024-07-21

  • gguf
  • text-generation
  • en
  • endpoints_compatible
  • conversational

גרסת GGUF שעברה הסרת מגבלות סירוב, מיועדת למי שרוצה להריץ מודל 9B מקומית בלי לחטוף הרצאות מוסר או סירובים אוטומטיים.

  • 155 GBמשקל הקבצים
  • 8,028הורדות בחודש
  • 53לייקים

מה זה

מדובר בהמרה של המודל מבית גוגל שעבר תהליך הסרת מגבלות על ידי איליה גוסב, וכאן נארז מחדש בפורמט קבצים שמתאים להרצה מקומית. התהליך הזה נועד לנטרל את מנגנוני הסירוב המובנים שגורמים למודלים רגילים לסרב לבקשות תמימות או כתיבה יצירתית חופשית, מבלי לפגוע ביכולות ההסקה הבסיסיות שלו באנגלית.

היוצר השתמש בכיול מסוג imatrix כדי למזער איבוד מידע בזמן הדחיסה, כך שגם רמות הדיוק הנמוכות שומרות על רמת שיחה סבירה. זהו פתרון שמיועד למי שרוצה מודל שפשוט מבצע את מה שמבקשים ממנו, בניגוד לגרסה המקורית של גוגל שמגיעה עם מדיניות סירובים הדוקה מאוד.

המשקל של הקבצים נע בין שלושה וחצי ג׳יגה בגרסאות הדחוסות ביותר ועד שלושים ושבעה ג׳יגה בגרסת הדיוק המלאה. המודל מכוון לחלוטין לטקסט באנגלית, ומציג יכולות שיחה וכתיבה שמקבילות למודלים מובילים בקטגוריית המשקל הזו.

מתאים ל

  • כתיבה יצירתית ללא צנזורה

    מתאים לסיפורים ותוכן בדיוני שבהם מודלים רגילים מסרבים לכתוב על קונפליקטים, אלימות מתונה או נושאים רגישים.

  • עוזר מקומי על חומרה ביתית

    רץ מצוין על כרטיסי מסך צרכניים של 8GB בגרסת הדחיסה המומלצת בלי צורך בחיבור חיצוני לרשת.

  • בדיקות אבטחה ומחקר

    מאפשר לבחון איך מודל שפה מגיב לפרומפטים ישירים כשההגנות המובנות שלו מנוטרלות ברמת המשקלים.

איפה זה נופל

ההסרה של מנגנוני הבטיחות אומרת שאין שום סינון על הפלטים, כך שהוא עלול לייצר טקסטים בעייתיים או פוגעניים בלי להסס. בנוסף, המודל אומן והותאם לאנגלית בלבד, ואין לצפות ממנו להבנה אמינה או יכולת ניסוח סבירה בעברית. לפני שמשלבים אותו במערכת שפונה למשתמשים חיצוניים, חייבים לבנות שכבת סינון עצמאית.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

הנתונים הרשמיים מציינים תמיכה באנגלית בלבד. המודל עשוי להחזיר מילים בודדות בעברית אם תתעקשו, אבל הטקסט יהיה משובש, איטי ולא מתאים לשימוש מעשי.

איזה קובץ מהרשימה כדאי להוריד?

גרסת Q4_K_M היא ברירת המחדל המומלצת ששוקלת 5.76GB ומספקת שילוב מעולה של איכות ומהירות. אם יש לכם כרטיס עם פחות זיכרון, אפשר לרדת לגרסת IQ4_XS.

איך מריצים

ההרצה פשוטה מאוד באמצעות תוכנות כמו LM Studio או ישירות דרך llama.cpp, כשהפורמט דורש מבנה פרומפט ייחודי עם תגיות מערכת ומשתמש ספציפיות של ג׳מה. כדי לקבל ביצועים טובים, עדיף לכוון לקובץ שקטן בגיגה או שניים מנפח זיכרון הווידאו של הכרטיס הגרפי שלכם.

לרוב האנשים, גרסת Q4_K_M במשקל 5.76GB תהיה הנקודה המאוזנת ביותר בין מהירות לאיכות, והיא נכנסת בקלות לכרטיס מסך ביתי עם 8GB זיכרון. אם יש לכם חומרה חלשה יותר או מעבדי ARM ייעודיים, ישנן גרסאות מותאמות כמו סדרת Q4_0_X_X שנותנות האצה מורגשת.

ollama run hf.co/bartowski/gemma-2-9b-it-abliterated-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת תנאי הרישיון המקוריים של gemma מבית גוגל. הרישיון מאפשר שימוש מסחרי ומחקר, אך כפוף למדיניות השימוש המקובל וההגבלות המשפטיות של גוגל, מה שעלול לייצר חיכוך משפטי לאור העובדה שמנגנוני הסירוב נוטרלו בו לחלוטין.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗