GPT
M

MultiVerse_70B

קוד פתוח

MTSAIRother2024-03-25

  • transformers
  • safetensors
  • llama
  • text-generation
  • en

גרסה מכווננת של Qwen בנפח של שבעים ושניים מיליארד פרמטרים, עם ממוצע מרשים במבחני ביצועים. מתאימים אותו למי שמחפש יכולות חשיבה וידע כללי גבוהות במיוחד באנגלית.

  • 72Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 8,456הורדות בחודש

מה זה

מדובר במודל שמבוסס על Qwen 72B אבל מוגדר תחת ארכיטקטורת LlamaForCausalLM. היוצרים שלו מ־MTSAIR השתמשו בשיטת אימון שהם קוראים לה multiverse, שלטענתם משפרת את עיבוד המידע. הכרטיס אמנם לא מפרט מה הטכניקה הזו כוללת בדיוק, אבל המבחנים בלוח המובילים מראים שהיא עובדת לא רע בכלל.

במדד Open LLM הוא מוציא ממוצע של 81.00 נקודות. הנתונים החזקים באמת הם בהיגיון לשוני עם כמעט תשעים אחוז ב־HellaSwag ו־87.53 ב־Winogrande, לצד ציון של 75.18 ב־TruthfulQA שאמור להעיד על פחות נטייה להזיות. גם במתמטיקה וידע כללי, עם GSM8k ו־MMLU סביב ה־76 עד 78 נקודות, הוא מתחרה ישירות במשקל הכבד של הקוד הפתוח.

מתאים ל

  • פתרון בעיות מתמטיות באנגלית

    עם תוצאה של 76.65 ב־GSM8k, הוא מתמודד טוב מאוד עם חישובים והסקה מורכבת.

  • בדיקת טקסטים ועובדות

    הציון של 75.18 ב־TruthfulQA מראה שהוא נוטה פחות להמציא תשובות שטותיות.

  • מחקר על שיטות אימון

    מתאים למי שרוצה לבחון בפועל את התוצאות של טכניקת ה־multiverse מול Qwen הרגיל.

איפה זה נופל

היוצרים מגדירים אותו כתוצר של ניסוי ובדיקות, ולא ככלי מוגמר שמוכן לייצור. הוא מאומן רשמית רק באנגלית, כך שאין מה לבנות עליו לפרויקטים בעברית. מעבר לזה, שיטת האימון שלו עדיין לא פורסמה ולא נבדקה על ידי הקהילה, מה שאומר שאין לדעת באילו פינות חשוכות הוא עלול להתנהג מוזר מחוץ למבחנים הסטנדרטיים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בשביל לעבד טקסטים בעברית?

המודל מתועד ומוגדר לשפה האנגלית בלבד. אף אחד לא בדק או התאים אותו לעברית, ולכן הוא כנראה יעשה המון טעויות או פשוט ייכשל בהבנה בסיסית.

למה שהמודל יוגדר כ־Llama אם הוא מבוסס על Qwen?

היוצרים המירו את המשקולות כך שיתאימו לארכיטקטורה של LlamaForCausalLM. זה מאפשר להריץ אותו ישירות בספריית transformers ובכלים קיימים שתומכים בפורמט הנפוץ של לאמה בלי צורך בקוד מותאם אישית.

איך מריצים

כדי לפתוח את 135 הג'יגה של הקבצים האלה בדיוק המקורי של bfloat16, תצטרכו לפחות שני כרטיסי A100 או H100 של 80 ג'יגה. גם אם תעשו לו קוונטיזציה לארבעה ביטים, עדיין תצטרכו כרטיס מקצועי בודד של ארבעים ושמונה ג'יגה רק כדי שהמשקולות ייכנסו לזיכרון לפני שבכלל שלחתם פרומפט.

אם אין לכם שרת ייעודי כזה בחברה או תקציב ענן של כמה דולרים טובים לשעה, אין טעם לנסות להריץ אותו מקומית. עדיף בהרבה להשתמש ב־API מסחרי של מודלים דומים בגודל הזה מאשר לתחזק מכונה מפלצתית רק בשביל הניסוי.

from transformers import pipeline

pipe = pipeline("text-generation", model="MTSAIR/MultiVerse_70B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר בתור other בלי פירוט של תנאים ברורים או הפניה לטקסט משפטי. במצב כזה אסור להניח שאפשר לשלב אותו במוצר מסחרי. כל עוד MTSAIR לא מפרסמים תנאי שימוש מפורשים, עדיף להתייחס אליו ככלי למחקר בלבד.

הרישיון המלא בעמוד המודל ↗