GPT
V

vicuna-7b-v1.5-16k

קוד פתוח

lmsysllama22023-07-31

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסת צ'אט מבוססת Llama 2 שאומנה על שיחות משתמשים עם תמיכה בהקשר ארוך. מתאימה למי שצריך מודל שיחה עצמאי לעיבוד טקסטים ארוכים בלי תלות חיצונית.

  • 4,096טוקנים בהקשר
  • 12.6 GBמשקל הקבצים
  • 1,461הורדות בחודש
  • 84לייקים

מה זה

המודל נוצר על ידי LMSYS באמצעות אימון של Llama 2 על כ־125 אלף שיחות שנאספו מ־ShareGPT. בניגוד לגרסאות הבסיס של מטא, הוא מכוון ישירות להתנהגות של עוזר שיחה, כשהאימון בוצע עם הרחבת הקשר באמצעות linear RoPE scaling כדי להתמודד עם רצפים ארוכים של טקסט.

הוא מיועד להרצה בסביבת transformers או FastChat, שמציעה גם ממשק תואם API של OpenAI. התוצאות שלו נבדקו במבחני שופט אוטומטי ובדירוגי העדפת אדם מול מודלים אחרים, שם הוא בולט בעיקר בשיחה חופשית ומענה מובנה יחסית לגודל שבעה מיליארד פרמטרים.

מתאים ל

  • בוט שיחה מקומי

    מאפשר להריץ עוזר שיחה שלם בתוך רשת פנימית בלי להוציא מידע החוצה.

  • ניתוח שיחות ומסמכים

    התאמה לעיבוד רצפי שיחה ממושכים בזכות האימון הייעודי על טקסטים ארוכים.

  • מחקר התנהגות מודלים

    בסיס פתוח ונוח לבדיקות של מנגנוני שפיטה והערכת ביצועי שפה.

איפה זה נופל

יוצרי המודל הגדירו אותו בעיקר למחקר ולתחביבים, ולא כמוצר מוגמר לייצור. הנתונים מגיעים מ־ShareGPT, מה שאומר שהוא סופג הטיות, שגיאות עובדתיות וסגנון תשובות ישירות משיחות רשת בלי סינון מלא. לפני שמשלבים אותו במערכת אמיתית, חייבים לבדוק הזיות בטקסטים ארוכים ולוודא שהוא לא מייצר תוכן בעייתי.

אותה משפחה

vicuna יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מריצים אותו עם תאימות למערכות קיימות?

LMSYS מספקים את חבילת FastChat. היא מאפשרת להרים שרת מקומי שחושף נקודות קצה בפורמט זהה לזה של OpenAI, כך שקל לחבר אליו קוד קיים בלי לשכתב את הקריאות.

האם הוא מתאים לשימוש מסחרי באפליקציה?

הרישיון של Llama 2 מאפשר שימוש מסחרי תחת תנאי הרישיון המקוריים של מטא. עם זאת, מכיוון שהנתונים מבוססים על שיחות ShareGPT, כדאי לוודא שהמחלקה המשפטית אצלכם מאשרת שימוש בתוצרי מידע כזה.

איך מריצים

כדי להריץ אותו מקומית צריך להוריד כ־12.6 ג'יגה־בייט של משקלים בפורמט float16. זה דורש כרטיס מסך עם לפחות 16 ג'יגה זיכרון כדי לטעון אותו ולשמור מקום לטוקנים בזמן היסק, במיוחד אם מנצלים הקשר ארוך שמעמיס על ה־VRAM.

אפשר להריץ אותו ישירות מקוד פייתון עם transformers או להרים שרת מקומי דרך FastChat. אם אין לכם חומרה ייעודית זמינה ברציפות, קריאה לשירות ענן מנוהל תהיה זולה ופשוטה יותר מתחזוקת שרת עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="lmsys/vicuna-7b-v1.5-16k")
print(pipe("שלום"))

הרישיון

הרישיון הוא Llama 2 Community License Agreement. הוא מתיר שימוש מסחרי ומחקרי, אך כפוף למגבלות של מטא, כולל מגבלת משתמשים חודשיים בקנה מידה ענק ואיסור על שימוש בפלט לאימון מודלים מתחרים. בנוסף, יש לזכור שהאימון כלל מידע מ־ShareGPT, גורם שחברות מסוימות בוחנות בזהירות מבחינה משפטית.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗