GPT
V

vicuna-13b-v1.3

קוד פתוח

lmsysרישיון לא דווח2023-06-18

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסת צ'אט מבוססת LLaMA שאומנה על שיחות משתמשים אמיתיות. היא מתאימה בעיקר למחקר עצמאי ולמי שרוצה בוט שיחה מקומי בלי תלות בענן.

  • 2,048טוקנים בהקשר
  • 24.2 GBמשקל הקבצים
  • 7,043הורדות בחודש
  • 205לייקים

מה זה

מדובר במודל שנוצר באמצעות אימון של LLaMA המקורית על כ־125 אלף שיחות שנאספו מאתר ShareGPT. המטרה של LMSYS הייתה לייצר עוזר שיחה שמחקה את היכולות של צ'אטים מתקדמים, אך במשקל שמאפשר בדיקה עצמאית. ההערכה שלו נעשתה מול בנצ'מרקים מקובלים, העדפות אנושיות ושיפוט מבוסס מודלים.

בגרסה הזו, v1.3, מקבלים ארכיטקטורה של 40 שכבות בדיוק של float16. החומרים מראים שהפרויקט פותח כחלק ממערכת FastChat שמאפשרת להרים ממשק שורת פקודה או שרת API תואם OpenAI, מה שהופך את השילוב שלו בסביבות בדיקה לפשוט יחסית אם כבר יש לכם תשתית מוכנה.

מתאים ל

  • מחקר על עוזרי שיחה

    הוא אומן על 125 אלף שיחות אמיתיות, ולכן הוא מתאים לבדיקת התנהגות מודלים והערכת איכות תשובות.

  • ניסויי שרת FastChat מקומי

    התאימות המובנית ל־FastChat מאפשרת לבחון אינטגרציות של ממשקי שיחה ותשתיות API במעבדה סגורה.

  • השוואת ביצועים בארנה

    המודל שימש בסיס בלוחות התוצאות של Chatbot Arena, ומאפשר שחזור של תוצאות מדידה מול מודלים אחרים.

איפה זה נופל

חלון ההקשר מוגבל ל־2,048 טוקנים בלבד. זה מעט מאוד במונחים של היום ולא יחזיק שיחות ארוכות או קבצי קוד מורכבים. בנוסף, בעמוד המודל מופיעה הערה מפורשת שיש כבר גרסאות משקלים חדשות יותר, כך שאתם מורידים מהדורה שאינה העדכנית ביותר. השימוש בדאטה מ־ShareGPT גם אומר שהוא ירש את ההטיות והטעויות של השיחות המקוריות.

אותה משפחה

vicuna יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתוך אפליקציה בתשלום?

לא. המפתחים הגדירו במפורש רישיון לא-מסחרי שנועד למחקר בלבד. מעבר לזה, הוא נשען על משקלי LLaMA הראשונה שאינם פתוחים לשימוש מסחרי.

כמה זיכרון וידאו נדרש כדי להעלות אותו?

הקבצים שוקלים 24.2 ג'יגה-בייט בפורמט float16. תצטרכו כרטיס עם לפחות 32 ג'יגה-בייט זיכרון וידאו, או שילוב של כמה כרטיסים, כדי להריץ אותו בלי קוונטיזציה.

למה מופיעה אזהרה על גרסה חדשה בעמוד?

מפני ש־LMSYS המשיכו לעדכן את המשקלים ואת תהליכי האימון בגרסאות מאוחרות יותר. לפני שאתם מורידים 24 ג'יגה-בייט, שווה לבדוק את הקישור לעדכונים שמופיע בכרטיס.

איך מריצים

כדי להריץ אותו מקומית צריך להתמודד עם קבצים במשקל כולל של 24.2 ג'יגה-בייט. זה אומר שכרטיס מסך ביתי רגיל יתקשה להחזיק אותו בזיכרון בפורמט המקורי בלי חלוקה לכמה כרטיסים או שרת ייעודי בעל זיכרון וידאו נדיב.

ההרצה נעשית דרך ספריית transformers או ישירות עם הכלים של FastChat שתומכים בממשק שורת פקודה ו־API. אם אין לכם חומרה ייעודית בענן או מעבדה מקומית, פנייה לשירות ענן חיצוני עדיפה בהרבה על ניסיון להרים אותו על לפטוף פיתוח.

from transformers import pipeline

pipe = pipeline("text-generation", model="lmsys/vicuna-13b-v1.3")
print(pipe("שלום"))

הרישיון

בטבלת הנתונים לא מוגדר רישיון רשמי, אבל בטקסט עצמו LMSYS מציינים רישיון לא-מסחרי. המודל מיועד לחוקרים ולחובבים, והוא מבוסס על LLaMA הראשונה. אל תבנו עליו שום מוצר מסחרי, זה יסבך אתכם מבחינה משפטית.

הרישיון המלא בעמוד המודל ↗