GPT
G

Guanaco-13B-Uncensored-GGUF

קוד פתוח

TheBlokeapache-2.02023-09-08

  • transformers
  • gguf
  • llama
  • conversational
  • en

גרסה מכווצת של Llama 2 בגודל 13 מיליארד פרמטרים, שעברה אימון ייעודי לענות על כל שאלה בלי מסנני תוכן וסירובים.

  • 91.9 GBמשקל הקבצים
  • 3,534הורדות בחודש
  • 43לייקים

מה זה

המודל מבוסס על Llama 2 13B ועבר כוונון עדין במשך 4 מחזורים על גרסה לא מסוננת של מאגר Guanaco. ההבדל העיקרי בינו לבין מודלים רגילים בגודל הזה הוא הסרת מעצורי הבטיחות. בזמן שמודל סטנדרטי יסרב לייצר טקסטים מסוימים עקב מדיניות שימוש, המודל הזה מחזיר תשובה ישירה בלי לחנך את המשתמש.

הקובץ מופץ בפורמט GGUF, מה שמיועד לריצה ישירה דרך llama.cpp ומאפשר לחלק את העבודה בין המעבד לכרטיס המסך. הדף אינו כולל מבחני ביצועים כמותיים, כך שאין כאן ציוני בנצ'מרק רשמיים, אלא דגש על אופי התוכן הלא מצונזר.

מתאים ל

  • סימולציות תוכן לא מסונן

    אימון ובדיקות על תרחישי שיחה קיצוניים שהיו נחסמים במודלים רגילים.

  • כתיבה יצירתית באנגלית

    יצירת דיאלוגים ודמויות חופשיות מעכבות בתוך כלים מקומיים כמו KoboldCpp.

  • בדיקות חוסן פנימיות

    בחינת תגובות של מערכות סינון צד שלישי מול פלטים חסרי צנזורה.

איפה זה נופל

היוצר מציין במפורש שהמודל אינו מתפקד טוב באף שפה שאינה אנגלית. אם תנסו לעבוד איתו בעברית, תקבלו תוצאות שבורות או חסרות משמעות. שנית, אין בו שום סינון תוכן, כך שאם מחברים אותו ישירות למשתמשי קצה ללא שכבת בדיקה חיצונית, הוא עלול לייצר פלטים פוגעניים או מסוכנים ללא אזהרה.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

הגרסה המאוזנת ביותר היא Q4_K_M. היא דורשת כ־10.37 GB של זיכרון ומספקת איכות טובה ביחס לנפח. אם החומרה חלשה יותר אפשר לרדת ל־Q3, אך הירידה באיכות מורגשת.

האם המודל תומך בעברית?

לא. בדף המודל מצוין במפורש שהביצועים חלשים בכל שפה שאינה אנגלית, ולכן הוא לא מתאים לעבודה בעברית.

איך מריצים

טוענים את קובץ ה־GGUF דרך כלים כמו llama.cpp, LM Studio, או ספריית ctransformers בפייתון. אין צורך להוריד את כל 91.9 הג'יגהבייט מהמאגר, אלא בוחרים קובץ יחיד. לשימוש יומיומי מומלץ לקחת את גרסת Q4_K_M ששוקלת 7.87 GB ודורשת כ־10.37 GB של זיכרון עבודה בריצה על המעבד בלבד.

אם יש לכם כרטיס מסך עם לפחות 12 GB של VRAM, אפשר לטעון את כל השכבות ישירות אליו ולקבל מהירות טובה. אם יש לכם רק מעבד ישן, עדיף להשתמש במודל מרוחק דרך ספק צד שלישי ולא להמתין דקות לכל תשובה.

ollama run hf.co/TheBloke/Guanaco-13B-Uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

היוצר סימן את המודל תחת Apache 2.0, אבל הוא מבוסס על Llama 2 ולכן כפוף גם לתנאי הרישיון של Meta. יש כאן סתירה משפטית שלא הוכרעה רשמית, כך שאם אתם מתכננים מוצר מסחרי, לא הייתי מסתמך על היתר גורף בלי לבדוק לעומק את תנאי השימוש של Meta.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗