GPT
S

SUS-Chat-34B

קוד פתוח

SUSTechapache-2.02023-11-29

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסת שיחה בגודל 34 מיליארד פרמטרים שמבוססת על Yi ומיועדת לאנגלית ולסינית. מציעה חלון של 8,192 טוקנים ומציגה ציונים גבוהים מול מודלים פתוחים כבדים בהרבה.

  • 8,192טוקנים בהקשר
  • 64.1 GBמשקל הקבצים
  • 100הורדות בחודש
  • 121לייקים

מה זה

המודל פותח בשיתוף בין Southern University of Science and Technology לבין IDEA-CCNL על בסיס Yi-34B. הוא עבר כוונון הוראות על 1.4 מיליארד טוקנים של שיחות רב-שלביות, מתמטיקה ומשימות היקש. צוות הפיתוח הרחיב את חלון ההקשר מ־4K ל־8K טוקנים באמצעות שיתוף קשב בין הוראות בטקסטים ארוכים, מה שמשפר את הדיאלוג המתמשך.

במבחני הביצועים הוא עוקף מודלים בגודל שלו ומתחרה גם במודלים של כ־70 מיליארד פרמטרים. במבחן gsm8k באפס דוגמאות הוא קיבל 80.06 לעומת 76.57 של Qwen-72b-Chat, ובמבחן MMLU באנגלית הוא הגיע ל־74.35, קרוב מאוד ל־74.52 של Qwen. במבחנים בסינית כמו CMMLU ו־C-Eval הוא הוביל על פני כל המודלים בטבלה, כולל GPT-4, עם תוצאות של 78.68 ו־82.42.

מתאים ל

  • בוט דו-לשוני באנגלית וסינית

    אימון ייעודי על 1.4 מיליארד טוקנים וציונים גבוהים ב־C-Eval ו־CMMLU מתאימים מאוד לתרגום ושיחה.

  • פתרון בעיות מתמטיות באנגלית

    תוצאה של 80.06 במבחן gsm8k באפס דוגמאות מראה יכולת ניתוח טובה מהממוצע לגודל 34B.

  • שיחות רב-שלביות מורכבות

    הרחבת ההקשר ל־8,192 טוקנים מאפשרת שמירה טובה יותר על רצף הדיאלוג וההוראות.

איפה זה נופל

היוצרים מדגישים שהמודל עבר רק כוונון מונחה (SFT) ללא שלב של למידה ממשוב אנושי (RLHF). החוסר ביישור העדפות גורם לתשובות בלתי סבירות, ומחריף הזיות, חוסר עקביות ושגיאות מצטברות בשיחות ארוכות. מעבר לכך, האימון התמקד באנגלית ובסינית בלבד, כך שאי אפשר להסתמך עליו לעיבוד עברית, והוא מחייב כיוונון זהיר של פרמטרי הדגימה כדי למנוע יציאה משליטה.

שאלות
נפוצות

האם המודל מתאים למוצרים שדורשים תמיכה בעברית?

המודל אומן ונבדק על אנגלית וסינית בלבד. אין תיעוד ליכולות בעברית, ובשל חוסר בנתוני אימון מתאימים הוא עלול להמציא מילים או להיכשל לחלוטין במשימות טקסט מקומיות.

למה המודל נוטה להזיות יותר ממודלים מסחריים סגורים?

הוא לא עבר שלב יישור מול העדפות אנושיות אלא רק כוונון מונחה על טקסט. היעדר תהליך כזה משאיר נטייה גבוהה לחוסר דיוק ולטעויות שנבנות לאורך השיחה, כפי שמצוין מפורשות במגבלות הכרטיס.

איך מריצים

הקבצים שוקלים 64.1 גיגה בייט בפורמט bfloat16, כך שהרצה מקומית מלאה ללא כימות דורשת לפחות שני כרטיסי מסך מקצועיים עם 48 עד 80 גיגה זיכרון וידאו. מי שרוצה להריץ אותו על חומרה צנועה יותר יצטרך לבצע קוונטיזציה או להרים שרת vLLM על תשתית ענן ייעודית.

הארכיטקטורה תואמת ל־LLaMA, כך שכל תשתית קיימת שתומכת בה תריץ את המשקלים דרך transformers. אם אין לכם גישה לשרתים עם כרטיסי A100 או מקבילים, עדיף להשתמש ב־API מרוחק ולא לנסות להחזיק אותו על תחנת עבודה ביתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="SUSTech/SUS-Chat-34B")
print(pipe("שלום"))

הרישיון

הקוד ברישיון Apache 2.0, אך השימוש במשקלי המודל עצמם כפוף להסכם הרישיון של 01-ai עבור Yi. הכרטיס מצהיר על שימוש מסחרי חינמי ומחקר אקדמי, אך חובה לבדוק את התנאים והמגבלות בהסכם המקורי של 01-ai לפני שילוב שלו במערכת מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗