GPT
W

wizardLM-7B-GPTQ

קוד פתוח

TheBlokeother2023-04-26

  • transformers
  • safetensors
  • llama
  • text-generation
  • text-generation-inference

גרסה מכווצת בשיטת GPTQ למודל הוראות שמבוסס על LLaMA המקורית. היא מיועדת למי שרוצה להריץ מודל טקסט מקומית על כרטיס מסך ביתי בלי לחנוק את הזיכרון.

  • 6.7Bפרמטרים
  • 2,048טוקנים בהקשר
  • 4.2 GBמשקל הקבצים
  • 208הורדות בחודש

מה זה

המודל הזה לוקח את WizardLM 7B ומכווץ אותו באמצעות כיול GPTQ, כך שמשקל הקבצים צונח לאזור של 4 עד 7 ג'יגה בייט במקום המשקל המקורי של חצי דיוק. הבסיס שלו מאומן על דאטהסט מורכב של הוראות בעזרת שיטת Evol-Instruct, מה שהפך אותו בשעתו לחזק משמעותית במעקב אחרי פקודות מורכבות לעומת מודלי 7B בסיסיים אחרים.

דף המודל מציע חלוקה לכמה ענפים שונים של כיול, בין 4 ביט ל־8 ביט, עם שילובים שונים של פרמטרים כמו group size וסדר הפעלה. כל ענף מאזן אחרת בין מהירות הריצה, תפיסת הזיכרות ודיוק הפלט, כאשר גרסאות עם act order מדויקות יותר אך איטיות בריצה עם AutoGPTQ על כרטיסי CUDA מסוימים.

מתאים ל

  • עוזר מקומי על חומרה ביתית

    דורש פחות מ־6GB זיכרון כרטיס מסך בגרסת ה־4 ביט, ומאפשר הרצה מלאה אופליין על מחשב אישי סטנדרטי.

  • מעקב אחר הוראות מובנות

    אימון ה־Evol-Instruct נותן לו ביצועים סבירים במענה ממוקד לפקודות קצרות באנגלית ביחס לגודלו.

  • ניסויי כיול והסקה

    ריבוי הענפים מאפשר לבדוק את ההשפעה של group size וסדר הפעלה על מהירות ואיכות בלי להמיר לבד.

איפה זה נופל

החיסרון המרכזי הוא שמדובר במודל מאפריל 2023 עם חלון הקשר קצרצר של 2,048 טוקנים בלבד, מה שלא מאפשר לעבד מסמכים ארוכים או לנהל שיחות מתמשכות. בנוסף, גרסאות ה־4 ביט סובלות מפגיעה בדיוק בהשוואה למודל המקורי, והאיטיות של AutoGPTQ בחלק מהגרסאות עם act order מורגשת היטב בזמן אמת. המודל מתקשה בעברית ולא מותאם לשפות שאינן אנגלית.

אותה משפחה

wizardLM יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה ענף הכי כדאי להוריד מהמאגר?

ענף ה־main הוא הבחירה הפשוטה ביותר אם אתם מחפשים תאימות רחבה ומהירות גבוהה עם ExLlama. אם הדיוק קריטי יותר מתפיסת הזיכרון, אפשר לבחור בגרסת 4 ביט עם 32g, אך קצב יצירת הטוקנים שלה ב־AutoGPTQ יהיה אטי יותר.

האם המודל תומך בעבודה בעברית?

הבסיס אומן בעיקר על טקסטים באנגלית והטוקנייזר שלו אינו מותאם לעברית. הוא ייצר פלטים שבורים, יבזבז טוקנים במהירות ויגיע לקצה חלון ההקשר תוך פסקאות בודדות.

מה תבנית הפרומפט שצריך לשלוח אליו?

חובה להשתמש בתבנית המקורית של WizardLM כדי לקבל תוצאות הגיוניות. שולחים את הטקסט שלכם ואחריו ירידת שורה עם המחרוזת Response ומנקודתיים, אחרת המודל ימשיך להמציא טקסט במקום לענות לפקודה.

איך מריצים

אתם צריכים כרטיס מסך של אנבידיה עם לפחות 6 עד 8 ג'יגה בייט של זיכרון ייעודי כדי להריץ את גרסאות ה־4 ביט בנוחות. ענף ה־main שוקל כ־4.52 ג'יגה בייט ועובד גם עם ExLlama, מה שנותן מהירות גבוהה במיוחד, בעוד גרסאות ה־8 ביט דורשות כ־10 ג'יגה בייט זיכרון גרפי לפחות ואינן נתמכות ב־ExLlama.

ההרצה מתבצעת ישירות דרך כלי כמו text-generation-webui באמצעות הזנת שם המאגר והענף המבוקש, או בקוד פייתון בעזרת ספריית AutoGPTQ. אם המטרה היא שימוש ייצורי יציב מרובה משתמשים, עדיף להשתמש ב־API מסחרי עדכני במקום לתחזק שרת עצמאי למודל ישן כזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/wizardLM-7B-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ללא פירוט תנאים ברור בכרטיס המודל. המקור מסתמך על LLaMA הראשונה ועל משקלי דלתא של WizardLM, מה שאומר שאין כאן היתר מסחרי חופשי ופתוח. לשימוש במוצר מסחרי זהו סיכון משפטי, והשימוש מתאים בעיקר למחקר, ניסויים ובדיקות פנימיות.

הרישיון המלא בעמוד המודל ↗