GPT
S

stable-vicuna-13B-GPTQ

קוד פתוח

TheBlokecc-by-nc-sa-4.02023-04-28

  • transformers
  • safetensors
  • llama
  • text-generation
  • causal-lm

גרסת 4 ביט מכווצת של צ'אטבוט מבוסס LLaMA ואימון RLHF. מקבלים מודל שיחה שרץ מקומית על כרטיס מסך פשוט יחסית.

  • 13Bפרמטרים
  • 2,048טוקנים בהקשר
  • 6.8 GBמשקל הקבצים
  • 151הורדות בחודש

מה זה

הבסיס כאן הוא Vicuna 13B שעבר אימון PPO בשיטת RLHF על ידי CarperAI, באמצעות דאטה־סטים של שיחות והוראות כמו OASST1, Alpaca ו־GPT4All. המטרה היתה לתת התנהגות מסודרת של עוזר וירטואלי, כשהתגובות מכוונות לפי העדפות אנושיות ולא רק השלמת טקסט עיוורת.

המפרסם TheBloke לקח את משקלי הדלתא, שילב אותם עם משקלי LLaMA המקוריים, ודחס את הכל ל־4 ביט בפורמט GPTQ. במקום לחפש חומרה יקרה להרצת המודל המלא, הקבצים תופסים 6.8 גיגה־בייט בלבד. חלון ההקשר עומד על 2,048 טוקנים, והאימון עצמו מוגדר לשפה האנגלית.

מתאים ל

  • עוזר שיחה מקומי באנגלית

    עבר כוונון RLHF לשיחות ומייצר מענה במבנה של עוזר אישי בלי לשלוח מידע לרשת.

  • ניסויי PPO ואימון המשך

    התשתית מבוססת קוד trlX ומתאימה לבדיקת שיטות תגמול נוספות בסביבת מחקר.

  • בדיקת ממשקי GPTQ ב־GPU

    משקל של 6.8 גיגה מאפשר לבדוק תאימות של ספריות הרצה מקומיות על חומרה ביתית.

איפה זה נופל

חלון ההקשר קצר מאוד, רק 2,048 טוקנים, מה שלא מאפשר לנתח מסמכים ארוכים או להחזיק שיחות מתמשכות. המודל אומן על אנגלית בלבד ולכן לא מתאים לעברית. בנוסף, המפתחים מודים שלא ביצעו בדיקות רעילות או הטיות בעקבות האימון הנוסף, והבסיס עדיין עלול לפלוט מידע שגוי או פוגעני. אין להתייחס למידע שהוא מציג כמקור אמת.

אותה משפחה

stable-vicuna יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ עדיף להוריד מתוך השניים?

אם אתם עובדים עם התקנה אוטומטית פשוטה של text-generation-webui, הורידו את קובץ ה־compat מהענף הראשי. אם התקנתם ידנית את הקוד המעודכן של GPTQ-for-LLaMa, עברו לענף latest והורידו את הקובץ עם act-order לאיכות מעט טובה יותר.

האם המודל יבין עברית?

הכרטיס מגדיר את שפת המודל כאנגלית בלבד. חלק מנתוני OASST1 כללו שפות נוספות, אבל המודל לא עבר כוונון ייעודי לעברית ולכן התוצאות יהיו שבורות ולא מדויקות.

איך צריך לבנות את הפרומפט בשביל לקבל תוצאה טובה?

המודל מצפה לתבנית קבועה מראש. מתחילים בתווית Human לפני השאלה, ואחריה שוברים שורה לתווית Assistant שממנה המודל מתחיל להשלים את התשובה.

איך מריצים

המודל דורש כרטיס מסך שמסוגל להחזיק כ־7 גיגה־בייט בזיכרון ה־VRAM, כך שכרטיס של 8 גיגה־בייט יכול להספיק להסקה. בריפו יש שני קבצים: קובץ compat שעובד בצורה חלקה עם כלי התקנה פשוטים כמו text-generation-webui, וקובץ latest שנבנה עם דגל act-order ומציע דיוק קצת יותר טוב אך דורש גרסאות קוד עדכניות של GPTQ-for-LLaMa.

אם כל מה שאתם צריכים זה מענה מהיר לבדיקות ולא התעסקות עם סביבות פייתון מקומיות או הגדרות דרייברים, עדיף פשוט לצרוך API של מודל קיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/stable-vicuna-13B-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא שילוב בעייתי. משקלי הדלתא שוחררו תחת cc-by-nc-sa-4.0, מה שאוסר שימוש מסחרי ומחייב שיתוף זהה. מעבר לכך, מודל הבסיס כפוף לרישיון המקורי של Meta ל־LLaMA, שגם הוא לא מסחרי. המודל מיועד למחקר וניסויים בלבד, ואי אפשר לשלב אותו במוצר שמייצר הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗