GPT
X

XVERSE-13B

קוד פתוח

xverseapache-2.02023-08-06

  • transformers
  • pytorch
  • xverse
  • text-generation
  • custom_code

מודל שפה רב לשוני בגודל 13 מיליארד פרמטרים, המיועד בעיקר למי שצריך תמיכה טובה בסינית ובאנגלית עם חלון הקשר של 8,192 טוקנים.

  • 8,192טוקנים בהקשר
  • 25.6 GBמשקל הקבצים
  • 163הורדות בחודש
  • 121לייקים

מה זה

מדובר במודל בסיס שפותח על ידי חברת Yuanxiang Technology משנג'ן ואומן על 1.4 טריליון טוקנים בגרסתו המקורית, עם אוצר מילים של 100,534 מילים שתומך ביותר מ־40 שפות. המבנה שלו הוא Decoder-only סטנדרטי, אך בזמן פרסומו הוא הציע חלון הקשר של 8,192 טוקנים, שהיה רחב יחסית לגודל כזה של מודלים. עיקר המיקוד שלו הושקע באיזון בין סינית לאנגלית, מה שניכר במבחני הביצועים.

במבחני שפה והבנה בסינית כמו C-Eval ו־CMMLU הוא הציג תוצאות של 54.7 ו־59.1, נתונים גבוהים משמעותית ממודלים כמו Llama 2 באותו הגודל. לעומת זאת, באנגלית ההבדלים מצטמצמים, ובמבחן MMLU הוא עומד על 55.1, קרוב מאוד ל־54.8 של Llama 2. בתחומי המתמטיקה והקוד המודל חלש, עם ציון 18.4 בלבד ב־GSM8K וציון 15.9 ב־HumanEval. המשמעות היא שהוא תוכנן בעיקר לטקסט כללי ולהבנת שפה ולא לחישובים מורכבים או כתיבת סקריפטים.

מתאים ל

  • עיבוד טקסטים בסינית ואנגלית

    הוא מציג ביצועים טובים משמעותית ממודלים מקבילים במענה על שאלות ובהבנת הנקרא בסינית.

  • ניתוח מסמכים בינוניים

    חלון הקשר של 8,192 טוקנים מאפשר להזין טקסטים ארוכים יחסית בלי צורך לקטוע אותם מוקדם.

  • בסיס לאימון והתאמה אישית

    הארכיטקטורה הסטנדרטית ואוצר המילים הרחב מהווים נקודת פתיחה טובה לפיין טיונינג של משימות ייעודיות.

איפה זה נופל

זהו מודל בסיס גולמי, כלומר הוא לא עבר התאמה לשיחה ולא מגיב היטב להוראות פשוטות בלי פרומפטים מובנים היטב או כוונון עדין. היכולות הטכניות שלו בעייתיות, והתוצאות ב־HumanEval ו־GSM8K מראות שהוא ייכשל במשימות תכנות או לוגיקה מתמטית. בנוסף, אף שהיוצרים מדווחים על תמיכה ב־40 שפות, הנתונים מתרכזים סביב אנגלית וסינית, ואין שום מידע על איכות התוצרים בעברית. הכרטיס גם מציין סכנה לפליטת מידע מוטה או שגוי ומחייב בדיקות בטיחות מראש.

אותה משפחה

XVERSE יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

הכרטיס מציין אימון על מעל 40 שפות אך מפרט רק סינית, אנגלית, רוסית וספרדית. אין נתונים על עברית, וסביר להניח שהיכולות בה נמוכות מאוד.

האם כדאי להשתמש בו ישירות כצ'אטבוט?

לא. מדובר במודל בסיס שמיועד להשלמת טקסט, ועבור צ'אט עדיף להשתמש בגרסת XVERSE-13B-Chat שעברה אימון ייעודי לשיחות.

איך מריצים

כדי להריץ אותו צריך זיכרון וידאו שיחזיק 25.6 ג'יגה בייט של משקולות בדיוק bfloat16, מה שאומר שכרטיס בודד של 24 ג'יגה לא יספיק בלי קוונטיזציה. תצטרכו כרטיס מקצועי עם 32 עד 48 ג'יגה בייט, או פיצול על פני שני כרטיסים צרכניים. הטעינה נעשית דרך ספריית transformers הרגילה, אך מחייבת שימוש בדגל trust_remote_code מפני שהארכיטקטורה מותאמת אישית.

אם אין לכם תשתית כזו זמינה, מודל של 13 מיליארד פרמטרים דורש התעסקות רבה מדי בהקמה ותחזוקה לעומת התמורה. במקרים שבהם אתם זקוקים לפתרון פשוט, עדיף לפנות למודל גדול יותר דרך ספק שירות חיצוני במקום לשלם על שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="xverse/XVERSE-13B")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון apache-2.0, אבל המשקולות כפופות להסכם נפרד. הן פתוחות לגמרי למחקר, ושימוש מסחרי מוגדר כחינמי אך דורש הגשת טופס בקשה ואישור מול החברה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗