GPT
V

vicuna-7b-1.1

קוד פתוח

eachadeaapache-2.02023-04-13

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

מודל שיחה פתוח שמבוסס על אימון LLaMA על שיחות משתמשים מ־ShareGPT. מתאים למי שמחפש צ'אטבוט קל יחסית למחקר או ניסויים מקומיים.

  • 2,048טוקנים בהקשר
  • 12.6 GBמשקל הקבצים
  • 105הורדות בחודש
  • 104לייקים

מה זה

המשקלים האלה הם תוצאה של כוונון LLaMA על בסיס נתונים של 70 אלף שיחות מ־ShareGPT, שנעשה על ידי צוות חוקרים מברקלי, CMU, סטנפורד ו־UC סן דייגו. הוא בנוי לחולל טקסט ומיועד לתפקד כצ'אטבוט עצמאי שרץ על תשתית פרטית. גרסה 1.1 מתקנת את חישוב ה־loss באימון ומחליפה את תו ההפרדה הקודם בטוקן סיום רגיל, מה שמונע חריגות בפליטת טקסט.

הבדיקה של המפתחים כללה 80 שאלות בלבד, כשהשופט שקבע את האיכות היה GPT-4. זה נותן כיוון כללי על יכולת השיחה אבל לא מציג מדידה השוואתית מסודרת מול מבחני ביצועים מקובלים, כך שצריך לקחת את ההבטחות בערבון מוגבל.

מתאים ל

  • מחקר על מודלי שיחה

    הכרטיס מגדיר אותו לכך, והוא מתאים לבדיקת התנהגות מודלים שאומנו על שיחות רשת.

  • ניסויים מקומיים בצ'אט

    מאפשר הרצה מקומית על כרטיס מסך בודד ללא תלות ברשת או בשירותים חיצוניים.

  • בדיקת תאימות תשתיות

    גרסה 1.1 משתמשת בטוקן סיום סטנדרטי, מה שמקל על בדיקת ספריות הרצה שונות.

איפה זה נופל

ההערכה מבוססת על מדגם זעיר של 80 שאלות מול שופט אוטומטי, ולכן אין שום ערובה ליציבות בעולם האמיתי. חלון ההקשר מוגבל ל־2,048 טוקנים, כך שאי אפשר להזין לו מסמכים ארוכים או לנהל שיחות מתמשכות בלי לאבד את ההתחלה. מעבר לזה, המודל אומן על שיחות גולשים ולא עבר סינון בטיחות קפדני מעבר לכך.

שאלות
נפוצות

האם המודל מתאים למוצר מסחרי?

הרישיון הרשמי בעמוד הוא אמנם Apache 2.0, אבל יוצרי המודל הגדירו אותו למחקר בלבד. הוא אומן על שיחות שנאספו ממשתמשי ShareGPT, מה שמעלה שאלות לגבי זכויות יוצרים, ולכן לא מומלץ לבנות עליו שירות מסחרי.

מה ההבדל העיקרי בין הגרסה הזו לקודמות?

גרסה 1.1 שינתה את מפריד הטקסט לטוקן סיום שיחה רגיל במקום רצף סולמיות, מה שפותר בעיות עצירה ביצירת הטקסט ומאפשר תאימות טובה יותר לספריות הרצה. בנוסף תוקן חישוב השגיאה בזמן האימון.

כמה זיכרון דרוש כדי לעבוד איתו?

הקבצים שוקלים 12.6 ג'יגה-בייט ב־float16. כדי לטעון אותו ולבצע הסקה תצטרכו כרטיס מסך עם לפחות 16 ג'יגה-בייט VRAM, אחרת תצטרכו לבצע אופטימיזציות נוספות.

איך מריצים

כדי להריץ אותו צריך לפרוס 12.6 ג'יגה-בייט של משקלים בפורמט float16 דרך ספריית transformers. בפועל אתם חייבים כרטיס מסך עם לפחות 16 ג'יגה-בייט זיכרון גרפי כדי להחזיק את המודל ולבצע הסקה בלי לקרוס.

אם אין לכם חומרה כזו פנויה או שאתם לא רוצים להשקיע בשרת ייעודי, עדיף להשתמש ב־API מנוהל של מודלים אחרים. הרצה מקומית משתלמת רק כשאתם חייבים שליטה מוחלטת במידע או בודקים את ההתנהגות שלו ספציפית.

from transformers import pipeline

pipe = pipeline("text-generation", model="eachadea/vicuna-7b-1.1")
print(pipe("שלום"))

הרישיון

הרישיון מדווח כ־Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה של הקוד. יחד עם זאת, המפתחים מצהירים במפורש שהשימוש המיועד הוא מחקר בלבד, והאימון נשען על שיחות ShareGPT ומשקלי LLaMA המקוריים, עובדה שיוצרת סיכון משפטי למי שמנסה לשלב אותו במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗