GPT
Y

Yi-34Bx2-MoE-60B

קוד פתוח

cloudyuapache-2.02024-01-07

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • yi

שילוב של שני מודלי Yi בגודל 34B בארכיטקטורת MoE, שמכוון לביצועים חזקים באנגלית ובסינית. הוא מעניין בעיקר למי שרוצה חלון הקשר ענק וביצועי מבחנים גבוהים בלי להחזיק מודל צפוף של 70B.

  • 61Bפרמטרים
  • 200,000טוקנים בהקשר
  • 113 GBמשקל הקבצים
  • 8,385הורדות בחודש

מה זה

מדובר בהרחבה של מודלי Yi-34B למבנה תערובת מומחים בארכיטקטורת Mixtral, עם 61 מיליארד פרמטרים בסך הכל. השילוב נשען על המודלים bagel-dpo-34b-v0.2 ו־SUS-Chat-34B, ומיועד להפקת טקסט באנגלית ובסינית תוך ניצול יעיל יותר של שכבות החישוב בזמן ריצה.

במבחני Open LLM Leaderboard המודל הגיע לציון ממוצע של 76.72. המספר הזה נשען על תוצאות חזקות יחסית בידע כללי ובהיגיון, עם 77.47 ב־MMLU ו־85.23 ב־HellaSwag, לצד 75.51 במתמטיקה של GSM8k. הנתונים מראים יכולת חשיבה ופתרון בעיות מעל הממוצע למודלים פתוחים מתקופתו, אבל עדיין צריך לזכור שציוני מבחן סינתטיים לא תמיד משקפים שיחה חופשית בצורה מושלמת.

מתאים ל

  • עיבוד מסמכים ארוכים באנגלית

    חלון הקשר של 200,000 טוקנים מאפשר להזין תיעוד טכני נרחב או ספרים שלמים ישירות לפרומפט.

  • פתרון בעיות היגיון וקוד

    ציונים של מעל 75 ב־GSM8k ו־MMLU הופכים אותו למתאים למשימות ניתוח וחשיבה מובנית.

  • תרגום וניתוח טקסט בסינית

    האימון התמקד ספציפית בשילוב בין אנגלית לסינית, תחום שבו מודלים מערביים רבים מתקשים.

איפה זה נופל

במבחן TruthfulQA המודל קיבל 66.19 בלבד. זה ציון שמחייב בדיקה של עובדות, כי הוא עדיין נוטה להמציא תשובות שנשמעות נכונות במקום להודות שהוא לא יודע. מעבר לזה, המודל אומן והותאם לאנגלית ולסינית בלבד, כך שאין שום הבטחה או עדות לכך שהוא מתמודד היטב עם עברית, בניסוח או בהבנת הקשר מקומי.

שאלות
נפוצות

האם הוא יעבוד לי טוב בעברית?

הכרטיס מציין במפורש שהמודל מיועד לאנגלית ולסינית. לא דווח על אימון ייעודי לעברית, ולכן לא מומלץ להסתמך עליו למשימות שדורשות שפה טבעית בעברית בלי לבדוק אותו קודם.

אפשר להריץ אותו על מחשב אישי רגיל?

במשקל המלא של 113GB אין סיכוי להריץ אותו על מחשב ביתי. האפשרות היחידה למשתמש ביתי היא להוריד את גרסת ה־GGUF ולהשתמש בקוונטיזציה כבדה, וגם אז תצטרכו כמות נכבדה של זיכרון RAM או VRAM.

איך מריצים

כדי להריץ אותו במשקל המקורי צריך להתמודד עם 113 גיגה-בייט של קבצים בפורמט bfloat16. זה אומר שתצטרכו לפחות שני כרטיסי A100 או H100 של 80GB כדי לפרוס אותו באופן מלא עם הקשר רחב. בקוד הדוגמה המפתח מציע לטעון אותו בקוונטיזציית 4bit כדי לדחוס אותו לכרטיס בודד, או לחלופין לפנות לגרסת ה־GGUF הנפרדת שהוכנה עבורו.

אם אין לכם שרת ייעודי זמין, להחזיק מפלצת כזו רק בשביל כמה שאילתות ביום יעלה לכם הרבה כסף בחשבון הענן. במקרים שבהם אין דרישה קשיחה לפרטיות מוחלטת או הרצה מקומית, עדיף להשתמש ב־API מנוהל של מודלים מסחריים מקבילים ולחסוך את כאב הראש של התחזוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="cloudyu/Yi-34Bx2-MoE-60B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצר סגור ולהפיץ אותו חופשי. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וכתב הוויתור על האחריות של היוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗