GPT
M

Mixtral_34Bx2_MoE_60B

קוד פתוח

cloudyuapache-2.02024-01-05

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • yi

שילוב מומחים של שני מודלי 34B שמכוון למשימות באנגלית ובסינית עם הקשר ענק. הוא נותן ביצועים חזקים במבחנים ישנים, אבל דורש חומרה כבדה מאוד.

  • 61Bפרמטרים
  • 200,000טוקנים בהקשר
  • 113 GBמשקל הקבצים
  • 8,521הורדות בחודש

מה זה

מדובר במודל MoE שמחבר שני מודלים קיימים, bagel-dpo-34b-v0.2 ו־SUS-Chat-34B, תחת ארכיטקטורה של מיקסטרל עם 61 מיליארד פרמטרים. המטרה כאן הייתה ליצור כלי דו-לשוני באנגלית ובסינית, שיכול להחזיק שיחות ארוכות ולפתור בעיות מורכבות בעזרת חלון של 200,000 טוקנים.

במבחני הביצועים הישנים של Hugging Face הוא כיכב בראש הטבלה עם ציון ממוצע של 76.66, ורשם ציונים יפים של 77.34 ב־MMLU ו־74.60 ב־GSM8k. אבל כשהריצו עליו את המבחנים המעודכנים והקשים יותר, הממוצע שלו צנח ל־27.42, עם ציון חלש מאוד של 6.57 במתמטיקה ברמה גבוהה. זה אומר שהוא מתמודד טוב עם ידע כללי ושפה, אבל נחנק כשמעמיסים עליו לוגיקה כבדה.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון הקשר של 200,000 טוקנים מתאים לעיבוד ספרים, תיעוד טכני נרחב או פרוטוקולים ארוכים.

  • עיבוד דו-לשוני באנגלית וסינית

    המודל אומן ספציפית על שני הבסיסים האלה ומתאים לתרגום ולשיחה טבעית ביניהם.

  • מענה על שאלות כלליות

    תוצאות טובות במבחני ידע כללי הופכות אותו לכלי יעיל לשליפת מידע וניסוח תשובות.

איפה זה נופל

החולשה העיקרית שלו היא הסקת מסקנות מתמטית ומדעית מורכבת. במבחן MATH ברמה 5 הוא קיבל 6.57 בלבד, וב־GPQA קיבל 11.74, שזה בקושי מעל ניחוש אקראי. בנוסף, מדובר בחיבור קהילתי מוקדם של שני מודלים שונים, כך שאין כאן אופטימיזציה מסחרית מהודקת. אם המוצר שלכם צריך פתרון מדויק של בעיות כמותיות או עמידה נוקשה בהוראות מורכבות, הוא כנראה יאכזב אתכם בלי בדיקה קפדנית מראש.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על מעבד בלבד?

היוצר סיפק קוד להרצה על CPU, אבל זה לא מעשי לשימוש אמיתי. טעינת 113 גיגה-בייט של קבצים לזיכרון RAM ויצירת טוקנים ללא האצת חומרה תהיה איטית מדי לכל תרחיש חוץ מבדיקה טכנית בסיסית.

למה יש פער כזה גדול בין הציונים במבחנים השונים?

המבחנים הישנים בדקו בעיקר שאלות רב-ברירה וידע שטחי שבהם המודל מצטיין. המבחנים החדשים בוחנים הבנה עמוקה, פתרון בעיות שלב-אחר-שלב ומתמטיקה קשה, ושם ארכיטקטורת המיזוג הזו מתקשה לעמוד ברמה.

איך מריצים

כדי להריץ 113 גיגה-בייט של משקלים בפורמט bfloat16 מלא, תצטרכו שרת עם לפחות שני כרטיסי A100 או H100 של 80GB. אפשרות מעשית יותר למי שרוצה לבדוק אותו מקומית היא קוונטיזציה ל־4 ביט, שמופיעה ישירות בקוד הדוגמה של המפתח ודוחסת אותו לנפח זיכרון נגיש בהרבה.

אם אין לכם קלאסטר ייעודי או צורך קריטי בפרטיות נתונים שלא מאפשרת יציאה לרשת, עדיף להשתמש ב־API מסחרי. עלות החשמל והתחזוקה של מפלצת כזו בשרת ענן עצמאי פשוט לא מצדיקה את עצמה לשימוש מזדמן.

from transformers import pipeline

pipe = pipeline("text-generation", model="cloudyu/Mixtral_34Bx2_MoE_60B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗