GPT
S

Smaug-72B-v0.1

קוד פתוח

abacusaiother2024-02-02

  • transformers
  • safetensors
  • llama
  • text-generation
  • text-generation-inference

גרסת כוונון מבוססת Qwen-72B שהגיעה לראש טבלת ה־Open LLM בפברואר 2024. מתאימה למי שמחפש ביצועי הסקה ומתמטיקה חזקים במשקל פתוח, ומוכן לשלם במשאבי חומרה כבדים.

  • 72Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 8,596הורדות בחודש

מה זה

המודל בנוי על MoMo-72B ומקורו ב־Qwen-72B, אך עבר אימון בשיטה שנקראת DPO-Positive. לפי המפתחים, השיטה הזו מונעת ירידה בהסתברות לתשובות נכונות במשימות שבהן ההבדל בניסוח בין פלט טוב לפלט רע הוא קטן, כמו בפתרון בעיות חישוביות.

במבחני HuggingFace הוא עבר ממוצע של 80 נקודות, כולל 78.7 ב־GSM8K ו־77.15 ב־MMLU. במבחן MT-Bench הוא קיבל ציון 7.76, כאשר הירידה בסיבוב השני מ־8.18 ל־7.34 מעידה על קושי לשמר איכות גבוהה כשהשיחה מתארכת. התוצאות האלו מציבות אותו ככלי חזק למשימות מובנות, אך הנתונים מצביעים גם על מדדי זיהום מבחנים גבוהים יחסית בחלק מהמדדים.

מתאים ל

  • פתרון בעיות חישוב והיגיון

    אימון ה־DPOP תוכנן במיוחד לשפר משימות שבהן מרחק העריכה בין פתרון נכון לשגוי הוא מינימלי.

  • חילוץ ישויות ומבנה נתונים

    מייצר פלטי JSON מדויקים ומסודרים מתוך טקסטים ארוכים בהתבסס על חלון הקשר של 32,768 טוקנים.

  • מערכות שרת מקומיות סגורות

    מאפשר ביצועי ניתוח גבוהים ללא הוצאת מידע לאינטרנט בארגונים עם דרישות פרטיות מחמירות.

איפה זה נופל

הבעיה הבולטת ביותר היא מדד הזיהום ב־GSM8K שעומד על 1.00, מה שאומר שחלק ניכר מנתוני המבחן הופיעו באימון ולא מייצגים בהכרח יכולת הכללה טהורה. בנוסף, בדוגמת הקוד הרשמית שלו למציאת איברים משותפים ברשימות ללא מבני נתונים נוספים, הוא השתמש ברשימה חדשה ובכך נכשל לחלוטין בהוראה המרכזית. חובה לבחון אותו היטב על נתונים פרטיים לפני שסומכים עליו בכתיבת קוד.

אותה משפחה

Smaug יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל שומר על יציבות בשיחות צ'אט ארוכות?

הביצועים יורדים לאורך השיחה. לפי תוצאות MT-Bench הרשמיות, הציון בסיבוב הראשון עומד על 8.18 אך צונח ל־7.34 בסיבוב השני, מה שמעיד על שחיקה באיכות התשובות ככל שהאינטראקציה מתמשכת.

האם אפשר להסתמך עליו לכתיבת קוד מורכב?

לא בעיניים עצומות. אפילו בדוגמה שהובאה בכרטיס המודל הוא נכשל בדרישה מפורשת לא להשתמש במבנה נתונים נוסף, כך שהוא נוטה לפספס אילוצי מערכת עדינים ודורש בדיקה אנושית קפדנית.

איך מריצים

בדיוק המקורי של bfloat16 הקבצים שוקלים 135 ג'יגה, כך שאי אפשר להריץ אותו על פחות ממערך של מספר כרטיסי מסך עם זיכרון כולל של לפחות 160 ג'יגה וידאו. גם אחרי קוונטיזציה תצטרכו שרת ייעודי חזק או חומרת קצה יקרה מאוד כדי לקבל מהירות תגובה סבירה.

אם אתם לא מחויבים להחזקת הנתונים על שרתים מקומיים לחלוטין מטעמי אבטחה, החזקה של מפלצת כזו בשרת ענן פרטי תעלה סכומים גבוהים מדי בחודש, וסביר להניח שקריאה ל־API חיצוני תהיה זולה ופשוטה משמעותית.

from transformers import pipeline

pipe = pipeline("text-generation", model="abacusai/Smaug-72B-v0.1")
print(pipe("שלום"))

הרישיון

הרישיון המוגדר הוא other ואינו מפורט ישירות בעמוד כרישיון קוד פתוח סטנדרטי כמו Apache או MIT. היות שהוא מבוסס על שרשרת מודלים שמקורה ב־Qwen-72B, חלים עליו תנאי השימוש המקוריים של המודלים הללו, ולכן אי אפשר לשלב אותו במוצר מסחרי בלי לבדוק לעומק את שרשרת הרישיונות המשפטית של פרויקט Qwen ו־MoMo.

הרישיון המלא בעמוד המודל ↗