GPT
X

Xwin-LM-70B-V0.1

קוד פתוח

Xwin-LMllama22023-09-15

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסת כוונון מבוססת Llama 2 שהתמקדה בשיטות יישור מתקדמות. היא מתאימה למי שמחפש מודל שיחה פתוח וגדול במיוחד שהציג עליונות במבחני העדפה ישירים.

  • 4,096טוקנים בהקשר
  • 257 GBמשקל הקבצים
  • 91הורדות בחודש
  • 209לייקים

מה זה

הצוות של Xwin-LM לקח את הבסיס המוכר של מטא ויישם עליו שרשרת יישור שכללה אימון מונחה, מודלי תגמול וחיזוק ממשוב אנושי. המטרה היתה למקסם את איכות התשובות בשיחה חופשית, והתוצאות במבחן AlpacaEval הציגו שיעור ניצחון של 60.61% מול GPT-4 וציון של 95.57% מול Davinci-003.

במבחנים רחבים יותר כמו Open LLM Leaderboard, הוא השיג ממוצע של 71.8 נקודות, שכולל 69.6 ב־MMLU ו־60.1 ב־TruthfulQA. מדובר במספרים שמציבים אותו מעל Llama-2-70B-Chat המקורי באותם מדדים. ההבדל המרכזי מורגש באופי התשובות, הן מפורטות ומנומקות יותר לעומת תשובות קצרות וסטנדרטיות.

מתאים ל

  • בוט שירות לקוחות מפורט

    המודל נוטה להחזיר תשובות מנומסות, ברורות ומורחבות מאוד במענה לפניות משתמשים.

  • הערכת איכות טקסטים

    בזכות יכולות היישור שלו הוא מתאים לדירוג אוטומטי של פלטים ממודלים קטנים יותר.

  • עיבוד פניות בארגון סגור

    פתרון טוב לארגונים עם חומרה ייעודית שדורשים ריצה מקומית מלאה ללא הוצאת מידע החוצה.

איפה זה נופל

חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, מה שמונע ממנו לטפל במסמכים ארוכים או בשיחות מתמשכות מורכבות. יוצרי המודל ציינו בעצמם ברשימת המשימות שיכולות מתמטיקה והסקה לוגית מורכבת עדיין דורשות הרחבה, כך שלא כדאי לבנות עליו לפתרון בעיות חישוביות. בנוסף, בדוגמה שהם עצמם סיפקו לגבי הזזת תפוח וצלחת, המודל כשל בהבנה פיזיקלית בסיסית וטען שהתפוח נשאר במטבח כי הזיזו רק את הצלחת.

אותה משפחה

Xwin-LM יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד אותו במקום את Llama-2-70B-Chat הרגיל?

אם המטרה שלכם היא לקבל שיחות קולחות ותשובות שמסבירות את עצמן לעומק, הנתונים מראים שהוא מנצח את מודל השיחה הרשמי של מטא. עם זאת, הוא דורש הקפדה יתרה על פורמט הפרומפט כדי לא להתפזר.

האם אפשר להשתמש בו לניתוח מסמכים גדולים?

לא. מגבלת ההקשר שלו נעצרת ב־4,096 טוקנים, שזה מעט מאוד לעבודה עם קבצים ארוכים. תצטרכו לחתוך טקסטים לחלקים קטנים או לחפש ארכיטקטורה אחרת לגמרי למשימות כאלה.

איך מריצים

המשקל הגולמי של הקבצים מגיע ל־257 גיגה-בייט בפורמט float32 המחולק ל־37 חלקים. כדי לטעון אותו בלי קוונטיזציה תצטרכו שרת עם לפחות ארבעה כרטיסי A100 או H100 של 80GB, אחרת הזיכרון פשוט ייגמר בטעינה. אפשר להריץ אותו דרך transformers או vLLM, אך חובה לשמור על מבנה התבנית של Vicuna עם סיומות ה־USER וה־ASSISTANT כדי לקבל פלט קוהרנטי.

אם אין לכם תשתית ענן ייעודית ותקציב חומרה כבד, להרים מפלצת כזו לבד בשביל כמה שאילתות ביום זה מהלך לא כלכלי. במקרים כאלה עדיף לפנות ל־API חיצוני או לבחור בגרסאות ה־7B וה־13B של אותה סדרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Xwin-LM/Xwin-LM-70B-V0.1")
print(pipe("שלום"))

הרישיון

המודל כפוף לתנאי הרישיון של Llama 2 מבית מטא. הרישיון מתיר שימוש מסחרי ומחקר, אך מטיל מגבלות אם המוצר שלכם מגיע ליותר מ־700 מיליון משתמשים חודשיים, ומחייב לעמוד במדיניות השימוש המקובל של מטא. אם אתם משלבים אותו במוצר מסחרי קטן עד בינוני אין בעיה, כל עוד אתם עומדים בתנאי הבסיס הללו.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗