GPT
W

Wizard-Vicuna-30B-Uncensored-GPTQ

קוד פתוח

TheBlokeother2023-05-30

  • transformers
  • safetensors
  • llama
  • text-generation
  • uncensored

גרסה מכווצת בשיטת GPTQ למודל 33B שאומן בלי מעצורי מוסר והטפה. הוא מיועד למי שמחפש מודל בגודל בינוני שעונה ישירות על כל הנחיה.

  • 33Bפרמטרים
  • 2,048טוקנים בהקשר
  • 15.8 GBמשקל הקבצים
  • 285הורדות בחודש

מה זה

הבסיס כאן הוא מודל בגודל 33 מיליארד פרמטרים שנוצר על ידי אריק הרטפורד, ועבר קוונטיזציה על ידי TheBloke כדי להקל על הריצה בכרטיסי מסך. מטרת האימון המקורית הייתה הסרת יישור וצנזורה, באמצעות ניקוי שיטתי של תשובות מטיפות או מסרבות ממאגר הנתונים. המודל מתבסס על ארכיטקטורת LlamaForCausalLM עם 60 שכבות.

התוצאה היא מנוע שיחה שלא מסרב לבקשות ולא מרצה למשתמש. עם זאת, הוא הוגדר עם אורך הקשר קצר של 2,048 טוקנים, ותומך רשמית באנגלית בלבד. דף המודל לא מציג מבחני ביצועים או ציונים השוואתיים, כך שקשה לדעת מראש איך דיוק הפלט מושפע מפעולת הדחיסה מעבר לחיסכון הפיזי במקום.

מתאים ל

  • מחקר על התנהגות מודלים

    מאפשר לבחון תגובות גולמיות של מודל שפה בגודל 33B ללא פילטרים מובנים.

  • אימון שכבות יישור עצמאיות

    מהווה בסיס נקי להוספת מגבלות מותאמות אישית, למשל באמצעות LoRA.

  • יצירת טקסט ישיר באנגלית

    עונה להנחיות מורכבות באנגלית בלי לחנך או לסרב לפניות המשתמש.

איפה זה נופל

ליוצר אין שום מנגנוני בטיחות פנימיים. כרטיס המודל מצהיר במפורש שההתנהגות דומה לסכין או לרכב, וכל האחריות המשפטית על הפלט מוטלת על המשתמש. חלון ההקשר מוגבל ל־2,048 טוקנים, מה שמונע ממנו לנתח מסמכים ארוכים או לנהל שיחות ממושכות. בנוסף, השפה המוגדרת היא אנגלית בלבד, וללא בדיקות התאמה לעברית סביר להניח שהפלט בשפות אחרות יהיה ירוד ומשובש.

אותה משפחה

Wizard-Vicuna-30B-Uncensored יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

באיזה ענף כדאי לבחור להורדה?

הענף הראשי main מספק דחיסה של 4 ביט ללא group size ושוקל 16.94 גיגה בייט. הוא מתאים לטעינה מהירה ב־ExLlama תוך חיסכון בזיכרון, בעוד ענפי 32g נותנים דיוק גבוה יותר במחיר של משקל גדול יותר.

האם המודל יצנזר בקשות שיש בהן סיכון?

לא. היוצר מחק מראש את כל הנתונים שכללו סירובים או הטפות מוסר. המודל יענה על כל בקשה בדיוק כפי שהיא מנוסחת, והאחריות על התוצאות חלה כולה על מי שמריץ אותו.

איך מריצים

המודל מוצע בכמה ענפים שנבדלים ברמת הדחיסה. הענף הראשי שוקל 16.94 גיגה בייט בפורמט 4 ביט ללא group size, וישנן גרסאות 4 ביט עם חלוקה לקבוצות שמגיעות עד 19.44 גיגה בייט, לצד גרסאות 3 ביט ששוקלות פחות מ־14 גיגה בייט וגרסאות 8 ביט שדורשות קרוב ל־34 גיגה בייט. גרסאות ה־4 ביט נתמכות במנוע ExLlama ובממשק text-generation-webui, ואפשר לטעון אותן ישירות דרך ספריית AutoGPTQ או Transformers מגרסה 4.32.0 ומעלה.

כדי להריץ את גרסת ה־4 ביט צריך מעבד גרפי עם מספיק זיכרון וידאו להחזקת הקבצים וחישובי הריצה, בעוד גרסאות ה־8 ביט דורשות זיכרון כפול. אם אין ברשותכם חומרת שרת ייעודית שתחזיק נפחים כאלה, או אם העבודה שלכם דורשת חלון הקשר ארוך בהרבה מ־2,048 טוקנים, עדיף להשתמש ב־API חיצוני של שירות מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Wizard-Vicuna-30B-Uncensored-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other, ללא קישור לטקסט משפטי מלא או פירוט תנאים מסחריים בדף הנוכחי. המודל מתבסס על Llama המקורית ומאגרי מידע מסוימים שאינם מפורטים. ללא רישיון מסחרי ברור ומתועד, שילוב של הקבצים האלה במוצר מסחרי כרוך בסיכון משפטי ומומלץ לבדוק את מקור הנתונים לפני השימוש.

הרישיון המלא בעמוד המודל ↗