GPT
M

magnum-v1-72b

קוד פתוח

anthracite-orgother2024-06-17

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

המודל הזה מנסה לשחזר את סגנון הכתיבה של קלוד 3 על בסיס קוון 72B. אם חיפשתם איכות פרוזה ומשחקי תפקידים במשקל כבד בלי להיות תלויים באנתרופיק, זו הסיבה לבדוק אותו.

  • 73Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 213הורדות בחודש

מה זה

מדובר בכיוונון מלא על גבי Qwen-2 72B Instruct, שנעשה בעזרת שמונה מאיצי AMD Instinct MI300X על פני 55 מיליון טוקנים של נתוני משחקי תפקידים. המטרה המוצהרת של הפרויקט היא לחקות את רמת הפרוזה והסגנון של Claude 3 בדגמי Sonnet ו־Opus. הוא עובד בפורמט ChatML רגיל ומחזיק חלון הקשר של 32,768 טוקנים.

במדדי ה־Open LLM Leaderboard הוא הגיע לממוצע של 42.21, כאשר ב־IFEval הוא עומד על 76.06 וב־BBH על 57.65. המספרים האלה מראים שהוא יודע לעקוב אחרי הוראות בסיסיות בצורה יציבה למדי, אבל במבחני היגיון וידע מורכבים כמו GPQA עם 18.79 בלבד או MATH רמה חמש עם 35.27, הוא לא נועד להתחרות במודלים של מדעים מדויקים אלא להישאר כלי לכתיבה זורמת.

מתאים ל

  • משחקי תפקידים באנגלית

    הוא אומן על 55 מיליון טוקנים של שיחות ופרוזה בדיוק למטרה זו.

  • כתיבה יוצרת וסיפורת

    מכוון לסגנון הטקסטואלי של קלוד 3 ללא שימוש בשירותי ענן סגורים.

  • הפקת דיאלוגים מורכבים

    פורמט ה־ChatML וגודל 73B מאפשרים שמירה על קול וסגנון אחיד לאורך שיחה.

איפה זה נופל

המודל אומן רק על אנגלית וסינית, כך שאין כאן שום הבטחה לעברית תקינה ולא כדאי לבנות עליו לממשקים מקומיים. מעבר לזה, במבחני חשיבה כבדים כמו GPQA ו־MuSR התוצאות שלו נמוכות מאוד, 18.79 ו־15.62, מה שאומר שהוא יזייף בעובדות ולא יתאים למשימות ניתוח מדעיות או מתמטיות. גם שדה הבטיחות בכרטיס המודל נשאר ריק לגמרי עם שלוש נקודות, כך שאין פירוט על סינונים או מגבלות פלט.

אותה משפחה

magnum יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

האימון וההגדרה הרשמית כוללים רק אנגלית וסינית. אפשר לשלוח לו עברית בגלל בסיס הנתונים הכללי של Qwen, אבל האיכות והתחביר יהיו רחוקים מביצועיו בשפות הנתמכות ולא הייתי מסתמך עליו למשימות בעברית.

איזה סוג שרת נדרש כדי להריץ אותו באופן עצמאי?

הקבצים שוקלים 135 גיגה-בייט בפורמט המקורי, ולכן צריך שרת עם לפחות שני כרטיסי 80GB VRAM כדי לטעון אותו ולעבוד עם הקשר סביר. ללא ציוד ברמה הזו תצטרכו לפנות לגרסאות מכווצות או לשירותי אירוח חיצוניים.

איך מריצים

בשביל להריץ אותו במשקל המקורי בפורמט bfloat16 תצטרכו להתמודד עם 135 גיגה-בייט של קבצים, מה שמחייב לפחות שני כרטיסי A100 או H100 של 80 גיגה כדי שיהיה מקום גם לזיכרון הריצה וההקשר. הוא נתמך ישירות בספריית transformers עם ארכיטקטורת Qwen2ForCausalLM.

אם אין לכם אשכול שרתים ייעודי במחיר של כמה דולרים לשעה, אין שום הגיון להרים מפלצת כזאת בבית בלי קוונטיזציה כבדה. לרוב השימושים, אם יש ספק צד שלישי שמגיש אותו ב־API לפי טוקנים, זה יהיה זול ופשוט בהרבה מתחזוקת תשתית עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="anthracite-org/magnum-v1-72b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי מסוג MIT או Apache. המשמעות היא שאין הרשאה ברורה ומיידית לשימוש מסחרי, וחובה לבדוק את תנאי השימוש המקוריים של Qwen2 שעליו הוא אומן לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗