GPT
W

Wizard-Vicuna-13B-Uncensored-SuperHOT-8K-GPTQ

קוד פתוח

TheBlokeother2023-06-27

  • transformers
  • safetensors
  • llama
  • text-generation
  • custom_code

גרסת קוונטיזציה של 13B שמחברת חופש מוחלט מסינון תכנים עם הקשר מורחב של 8,192 טוקנים. היא מיועדת למי שצריך להריץ מקומית טקסטים ארוכים בלי לקבל סירובים מהמודל.

  • 13Bפרמטרים
  • 8,192טוקנים בהקשר
  • 6.9 GBמשקל הקבצים
  • 93הורדות בחודש

מה זה

מדובר בשילוב של Wizard Vicuna הלא מצונזר של אריק הרטפורד יחד עם שיטת SuperHOT של Kaio Ken להרחבת חלון ההקשר, כשכל זה עבר דחיסה ל־4 ביט באמצעות GPTQ. התוצאה היא מודל בגודל 13 מיליארד פרמטרים שמסוגל לעבד עד 8K טוקנים במקום המגבלה המקורית של 2,048, ובמקביל נקי מכל שכבת התאמה מוסרית מובנית.

בניגוד למודלים סטנדרטיים בגודל הזה, המפתח הסיר באופן יזום תשובות מטיפות או מסרבות מדאטהסט האימון. השילוב של חלון עבודה גדול והסרת החסימות הופך אותו לכלי גמיש מאוד למשימות יצירתיות או ניתוח מסמכים חופשי, אם כי מדובר בגרסה ניסיונית שמסתמכת על פתרונות טכניים נקודתיים כדי למתוח את טווח המיקום של הטוקנים.

מתאים ל

  • ניתוח טקסטים ארוכים

    חלון הקשר של 8K מאפשר לקרוא קבצים ומסמכים מורכבים בבת אחת בלי לקטוע את המידע.

  • כתיבה יצירתית חופשית

    היעדר מנגנוני צנזורה מאפשר כתיבת עלילות ודיאלוגים מורכבים ללא סירובים אוטומטיים.

  • בסיס למערכות מותאמות

    מבנה נקי מאליינמנט מוסרי שמאפשר אימון שכבות RLHF עצמאיות לפי כללים שאתם מגדירים.

איפה זה נופל

זהו מודל נטול רסן לחלוטין וללא שכבות הגנה, מה שאומר שהוא ייצר תוכן פוגעני, רעיל או שגוי בלי לסרב או להתריע. האחריות על כל פלט חלה עליכם בלבד, בדיוק כפי שהיוצר מדגיש בתיעוד.

מעבר לכך, מדובר בפרויקט ניסיוני שמחייב הגדרות ידניות כמו קביעת מקדם דחיסת מיקום ל־4 כדי לעבוד ב־8K, ויש דיווחים על תקלות בהרצה במצב Triton תחת GPTQ-for-LLaMa.

שאלות
נפוצות

איך מפעילים את המודל כדי לנצל את כל 8,192 הטוקנים?

בטעינה דרך ExLlama יש לקבוע את max_seq_len ל־8192 ולהגדיר את compress_pos_emb ל־4. בקוד פייתון עם AutoGPTQ חובה להפעיל את הפרמטר trust_remote_code שמאפשר את הרצת מנגנון ה־RoPE המותאם.

האם המודל יפעל על המעבד ללא כרטיס מסך ייעודי?

לא, קובצי ה־GPTQ האלה מיועדים להרצה על כרטיסי מסך תומכי CUDA בלבד. להרצה על גבי מעבד רגיל יש לחפש גרסת GGML מתאימה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם זיכרון ייעודי של לפחות 10 עד 12 גיגה בייט כדי להחזיק את הקבצים ששוקלים 6.9 גיגה בייט יחד עם הקשר מלא. הכרטיס מותאם בעיקר להרצה ב־GPU דרך ExLlama בתוך text-generation-webui, או ישירות מקוד פייתון בעזרת ספריית AutoGPTQ.

אם אתם כותבים קוד, חובה להגדיר trust_remote_code כ־True כדי שמנגנון מתיחת ההקשר יעבוד. אם המטרה היא להריץ את המודל על מעבד רגיל ללא כרטיס גרפי, הקבצים האלה לא יתאימו ותצטרכו לחפש גרסאות GGML, ואם אין לכם חומרה ייעודית בכלל, עדיף להשתמש ב־API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Wizard-Vicuna-13B-Uncensored-SuperHOT-8K-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ללא פירוט רשמי של תנאי שימוש מסחריים בכרטיס המודל. היות שמדובר בנגזרת של מודלים מבוססי LLaMA יחד עם נתוני אימון מגוונים, לא מומלץ להטמיע אותו במוצר מסחרי סגור לפני שבודקים את מגבלות הרישוי של מודלי הבסיס.

הרישיון המלא בעמוד המודל ↗