GPT
W

Wizard-Vicuna-7B-Uncensored-GPTQ

קוד פתוח

TheBlokeother2023-05-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • uncensored

גרסת GPTQ דחוסה של מודל שנועד לענות על הכל בלי להטיף מוסר. מתאים למי שחייב מודל מקומי קל משקל שלא מסרב לפרומפטים שנויים במחלוקת.

  • 6.7Bפרמטרים
  • 2,048טוקנים בהקשר
  • 4.2 GBמשקל הקבצים
  • 453הורדות בחודש

מה זה

מדובר במודל שנוצר משילוב של WizardLM ו־Vicuna על בסיס LLaMA הראשון, עם שינוי מהותי: היוצר סינן מסט הנתונים תשובות שכללו הטפות מוסר או מנגנוני יישור מובנים. המטרה היא לתת בסיס גולמי שעונה ישירות לשאלות, כדי שהמפתח יוכל להלביש עליו מגבלות משלו במקום להילחם בסירובים של המודל.

הקובץ כאן הוא גרסה מכווצת של TheBloke בשיטת GPTQ, שנועדה לחסוך זיכרון ולרוץ על כרטיסים גרפיים ביתיים. הוא מיועד ליצירת טקסט חופשי ומענה על שאלות באנגלית לפי תבנית השיחה של Vicuna, בלי פילטרים מובנים.

מתאים ל

  • אימון שכבות יישור עצמאיות

    בסיס נקי ממוסר מובנה שמאפשר להלביש עליו שכבות LoRA או RLHF לפי דרישות הארגון.

  • משחקי תפקידים ויצירה

    מייצר טקסט ודיאלוגים חופשיים בלי לחסום תכנים אפלים או דמויות עם שפה בוטה.

  • בדיקות חוסן לפרומפטים

    מאפשר לבחון איך מודל מתנהג ללא פילטרים מקדימים כדי לבנות מערכות סינון חיצוניות.

איפה זה נופל

המודל מגיע בלי מעצורים בכלל, והיוצר מבהיר שהאחריות על הפלטים היא על המשתמש בלבד, בדיוק כמו שימוש בסכין או רכב. הוא ייצר תוכן פוגעני, מסוכן או שגוי אם תבקשו ממנו. מעבר לזה, חלון ההקשר קצר מאוד ועומד על 2,048 טוקנים בלבד, כך שהוא לא מתאים למסמכים ארוכים. המודל מאומן על אנגלית, והבסיס שלו ישן, כך שהוא לא מתמודד טוב עם שפות אחרות כמו עברית.

אותה משפחה

Wizard-Vicuna-7B-Uncensored יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מבין עברית?

המודל מוגדר ומאומן באנגלית בלבד. עברית תניב תוצאות שבורות, לא מדויקות או חסרות משמעות, ולא מומלץ להשתמש בו לשום מטלה שדורשת עברית.

איזו גרסת קובץ לבחור מתוך הרשימה?

לרוב המשתמשים מומלץ להוריד את ענף ה־4 ביט עם group size 128 או 64. הם מציעים איזון טוב בין צריכת זיכרון נמוכה, סביב 4 גיגה־בייט, לבין תמיכה ב־ExLlama שמספקת מהירות יצירת טקסט גבוהה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של אנבידיה שתומך ב־CUDA וספריות תואמות כמו AutoGPTQ, ExLlama או TGI. גרסאות ה־4 ביט תופסות בין 3.9 ל־4.52 גיגה־בייט זיכרון כרטיס מסך, כך שכרטיס עם 6 או 8 גיגה־בייט יריץ אותן בלי בעיה. גרסאות ה־8 ביט דורשות יותר מ־7 גיגה־בייט זיכרון גרפי ועובדות רק עם AutoGPTQ.

אם אתם צריכים רק בדיקה מהירה בלי להתעסק עם התקנות של ספריות פייתון ודרייברים, או אם אין לכם כרטיס מסך ייעודי, עדיף להשתמש ב־API מוכן ברשת. ההרצה המקומית משתלמת רק כשרוצים שליטה מלאה או מניעת סירובים ברמת השרת שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Wizard-Vicuna-7B-Uncensored-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ללא פירוט תנאים מלא בכרטיס. המודל מבוסס על LLaMA המקורי ומשלב דאטהסטים של ויקונה, מה שמעמיד בסימן שאלה שימוש מסחרי חופשי. אי אפשר להטמיע אותו במוצר מסחרי סגור בלי לבדוק לעומק את תנאי הבסיס של הדגמים המקוריים.

הרישיון המלא בעמוד המודל ↗