GPT
W

WizardLM-7B-uncensored-GPTQ

קוד פתוח

TheBlokeother2023-05-05

  • transformers
  • safetensors
  • llama
  • text-generation
  • uncensored

גרסת קוונטיזציה של מודל שיחה ללא סינון תכנים, שמתאימה למי שחייב שליטה מלאה בתשובות בלי הטפות מוסר. היתרון שלה הוא דרישות זיכרון נמוכות מאוד שרצות על חומרה ביתית.

  • 6.7Bפרמטרים
  • 2,048טוקנים בהקשר
  • 3.6 GBמשקל הקבצים
  • 573הורדות בחודש

מה זה

מדובר בהמרה של WizardLM 7B שפותח בידי אריק הרטפורד וכוונטט בידי TheBloke בשיטת GPTQ. המודל מתבסס על ארכיטקטורת Llama המקורית עם 32 שכבות וסך של כ־6.7 מיליארד פרמטרים. השוני המרכזי מול מודלים אחרים באותו גודל הוא הסרת מנגנוני הסינון וההטפות ממאגר האימון, כך שהתשובות ישירות וללא סירובים מובנים.

הפורמט שבו הוא מדבר דורש את התבנית של Vicuna, עם פניות של משתמש ועוזר. הקוונטיזציה ל־4 ביט דוחסת את המשקלים לגודל של פחות מ־4 גיגה-בייט בלי לאבד הרבה מדיוק ההסקה, מה שהופך אותו לנגיש מאוד לסביבות בדיקה מקומיות.

מתאים ל

  • בדיקת מערכות אבטחה וסינון

    מייצר פלטים ללא צנזורה כדי לבחון עמידות של מסננים חיצוניים לפני עלייה לאוויר.

  • עוזר מקומי על מחשב אישי

    דורש פחות מ־6 גיגה-בייט VRAM ומגיב ישירות בלי הטפות מוסר או סירובים קבועים.

  • אימון LoRA לתחומים מוגדרים

    משמש כבסיס נקי מעמדות אידאולוגיות לצורך כיוונון מחדש של מנגנוני בטיחות ייעודיים.

איפה זה נופל

הבעיה הגדולה ביותר היא היעדר מעצורים מוחלט. הכרטיס מבהיר שאין כאן שום מנגנון בטיחות מובנה, מה שאומר שהפלט יכול להיות רעיל, פוגעני או שגוי לחלוטין ללא כל התראה. אסור לחבר אותו לשירות לקוחות או ממשק פתוח ללא שכבת סינון חיצונית.

בנוסף, חלון ההקשר מוגבל ל־2,048 טוקנים בלבד. במשימות שדורשות קריאת מסמכים ארוכים או שיחות מורכבות הוא יאבד את תחילת השיחה מהר מאוד.

אותה משפחה

WizardLM-7B-uncensored יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יסרב לענות על שאלות רגישות?

לא. מאגר האימון נוקה מתשובות מתחסדות או מסרבות, ולכן הוא מייצר מענה כמעט לכל הנחיה. האחריות על התוכן היא של המפעיל בלבד.

האם אפשר להריץ אותו על מעבד רגיל בלי GPU?

הקבצים כאן מיועדים למאיצים גרפיים דרך GPTQ. אם רוצים להריץ על מעבד, צריך לחפש את גרסאות ה־GGUF של אותו מודל.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 6 גיגה-בייט זיכרון גרפי, שבו נכנסים משקלי המודל בגודל של כ־4 גיגה-בייט יחד עם הקשר העבודה. ההרצה עובדת חלק דרך ספריות כמו AutoGPTQ, שילוב עם Transformers או דרך מנוע ExLlama שנותן מהירות טובה מאוד בארכיטקטורת 4 ביט.

ההבדל בין הגרסאות בענפים השונים, כמו oobaCUDA או latest, מתמקד בעיקר בהפעלת Act Order ובסביבת הריצה. אם אתם צריכים הקשר ארוך ומענה מהיר על גבי שרתים בלי להתעסק עם תאימות דרייברים וספריות פייתון, שירות ענן חיצוני פשוט יחסוך לכם תחזוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/WizardLM-7B-uncensored-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר בתור other ומסתמך על תנאי השימוש המקוריים של Llama הראשונה ו־WizardLM. המשמעות היא שאין היתר מפורש לשימוש מסחרי, וכל מוצר שמיועד להפצה או למכירה מסתכן בהפרת תנאים. לשימוש מחקרי ובדיקות פנימיות אין בעיה.

הרישיון המלא בעמוד המודל ↗