GPT
V

vicuna-7b

קוד פתוח

AlekseyKorshukother2023-04-05

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסת צ'אט של שבעה מיליארד פרמטרים שאומנה על שיחות משתמשים אמיתיות. מי שמוריד אותה מחפש תשובות ישירות בלי מנגנוני הסינון המקוריים.

  • 12.6 GBמשקל הקבצים
  • 84הורדות בחודש
  • 111לייקים
  • 32שכבות

מה זה

הבסיס כאן הוא מודל שפה שנבנה על גבי LLaMA ועבר כוונון עדין על שבעים אלף שיחות מ־ShareGPT. ההבדל המרכזי מול הגרסה המקורית של צוות Vicuna הוא שהאימון הזה בוצע ללא סינון האתיקה שהם הפעילו, כך שהוא לא אמור לחסום או לעדן תשובות באופן יזום.

מבחינת יכולות, הוא מיועד ליצירת טקסט וניהול שיחה חופשית. הבדיקות של הפרויקט המקורי נשענו על שיפוט של GPT-4 מול שמונים שאלות מבחן, מה שאומר שההתנהגות שלו מחקה סגנון שיחה אנושי, אבל הוא מוגבל בידע וביכולות ההסקה שלו יחסית למודלים גדולים יותר.

מתאים ל

  • מחקר על מודלים ללא סינון

    בדיקה של השפעת הסרת מסנני הבטיחות על התשובות וההטיות של מודלי שפה קטנים.

  • ניסויי שיחה מקומיים

    הרצה מקומית על מחשב אישי לחובבי תחום שרוצים לבחון כוונון על דאטה של ShareGPT.

  • בדיקות השוואה מול גרסאות מכומתות

    השוואת ביצועים ודיוק בין משקלי המקור של float16 לגרסת ה־GPTQ הזמינה ברשת.

איפה זה נופל

בגלל שהורידו את סינון האתיקה באימון, הוא עלול לייצר תוכן פוגעני, שגוי או מוטה בלי שום מחסום פנימי. מעבר לזה, מדובר במודל משנת 2023 עם שבעה מיליארד פרמטרים בלבד, ולכן הוא נוטה להזיות בעובדות מורכבות ואינו מתאים לשום משימה שדורשת דיוק מוחלט לפני בדיקה ידנית קפדנית.

שאלות
נפוצות

האם הוא מתאים לשימוש מסחרי באפליקציה?

לא מומלץ בכלל. הרישיון מסומן כ־other ואינו מוגדר בבירור, מה שיוצר סיכון משפטי ישיר. בנוסף, היעדר הסינון הפנימי עלול לחשוף משתמשים לפלטים לא הולמים.

איזו חומרה חייבים כדי לעבוד איתו?

המשקלים תופסים 12.6 גיגה בפורמט float16, כך שצריך כרטיס מסך עם לפחות 16 גיגה זיכרון. לחומרה חלשה יותר כדאי לחפש את גרסת ה־GPTQ בארבעה ביט.

איך מריצים

כדי להריץ את המשקלים המקוריים בדיוק של float16 תצטרכו כרטיס מסך עם לפחות שישה עשר גיגה זיכרון, שכן המשקל הכולל מגיע ל־12.6 גיגה המחולקים בעשרים ושניים קבצים שונים. מי שרוצה לחסוך במשאבים יכול לפנות לגרסת ה־GPTQ בכימות של ארבעה ביט שהועלתה בנפרד.

אם אין לכם חומרה ייעודית מקומית עם מספיק VRAM, הרמה של שרת בענן רק בשביל הרצה של צ'אט בודד תהיה יקרה ולא משתלמת, ובמצב כזה עדיף לצרוך מודלים דרך שירותי צד שלישי.

from transformers import pipeline

pipe = pipeline("text-generation", model="AlekseyKorshuk/vicuna-7b")
print(pipe("שלום"))

הרישיון

הרישיון הרשמי בעמוד מסומן כ־other, למרות שבטקסט המקורי מוזכר Apache 2.0. מצב כזה מייצר אי ודאות משפטית מוחלטת. אסור לשלב אותו במוצר מסחרי בלי לברר קודם את תנאי השימוש המדויקים מול היוצר והמגבלות של מודל הבסיס שעליו הוא נשען.

הרישיון המלא בעמוד המודל ↗