GPT
S

Smaug-Llama-3-70B-Instruct

קוד פתוח

abacusaillama32024-05-17

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

כוונון ייעודי לשיחות מרובות שלבים על בסיס לאמה 70B, שמציג ציונים גבוהים במיוחד מול מודלים סגורים. הוא מתאים למי שרוצה ביצועי שיחה מתקדמים בקוד פתוח.

  • 71Bפרמטרים
  • 8,192טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 8,375הורדות בחודש

מה זה

מדובר בגרסה מכווננת של לאמה 3 בגרסת 70B, שפותחה על ידי חברת Abacus.AI במטרה לשפר שיחות מורכבות ומרובות שלבים בעולם האמיתי. לפי המבחנים שהמפתחים הציגו, הכוונון הזה מייצר קפיצה משמעותית ביכולת השיחה לעומת מודל הבסיס. במבחן Arena-Hard הוא מגיע לציון 56.7, לעומת 41.1 של מודל המקור, ומתקרב לקלוד 3 אופוס שקיבל 60.4.

במדד MT-Bench המודל מציג ממוצע של 9.21, מעט מעל GPT-4-Turbo שעומד על 9.19. המשמעות בפועל היא יכולת טובה במיוחד להבין הקשר מצטבר, לעקוב אחרי הנחיות מתמשכות ולא לאבד את הצפון בתשובה השנייה של השיחה. עם זאת, במבחני ידע קלאסיים כמו MMLU ומתמטיקה כמו GSM8K, הביצועים שלו זהים כמעט לחלוטין למודל המקור, כך שהיתרון ממוקד כולו במבנה השיחה ובאיכות המענה ולא בידע עובדתי רחב יותר.

מתאים ל

  • בוט שירות לקוחות מתקדם

    המודל שומר על עקביות ודיוק בשיחות ארוכות ומרובות שלבים, עם ציון 9.01 בסיבוב השני ב־MT-Bench.

  • עוזר שיחה למשימות מורכבות

    ביצועים שמגיעים ל־56.7 ב־Arena-Hard ומאפשרים הבנה טובה של בקשות משתמש עמוקות בקוד פתוח.

  • משחקי תפקידים וצ'אט אינטראקטיבי

    יכולת מעקב מדויקת אחרי הנחיות מערכת ואישיות מוגדרת בלי לאבד את ההקשר תוך כדי שיחה.

איפה זה נופל

חלון ההקשר מוגבל ל־8,192 טוקנים בלבד, שזה מעט מאוד למודל ברמה הזו ופוסל אותו מניתוח מסמכים ארוכים או ספריות קוד שלמות. מעבר לזה, במבחני OpenLLM Leaderboard הממוצע הכללי שלו הוא 78.7 לעומת 78.8 במודל המקורי, ובחלקם כמו ARC ו־GSM8K הוא אפילו קיבל ציון מעט נמוך יותר. כל השיפור שלו מרוכז בטון ובמבנה השיחה, ולא ביכולת לוגית או ידע.

שאלות
נפוצות

האם הוא יודע לפתור בעיות מתמטיקה טוב יותר מלאמה המקורית?

לא. במבחן GSM8K הוא קיבל 90.5 לעומת 91.1 של מודל המקור, ובמבחן MMLU קיבל 79.2 לעומת 80.0. השיפור מורגש רק באופן ניהול השיחה ולא ביכולות חישוב או ידע עובדתי.

איך משלבים אותו בקוד פייתון קיים?

טוענים את המודל דרך טרנספורמרס בדיוק bfloat16 ומשתמשים ב־chat template הרגיל של לאמה 3. חשוב להגדיר את הטוקן של סיום הודעה במערך ה־terminators כפי שמודגם בקוד המקור כדי למנוע יצירת טקסט אינסופית.

איך מריצים

כדי להריץ אותו ישירות דרך ספריית transformers של פייתון בדיוק bfloat16, צריך להוריד 131 גיגה בייט של משקלים. מודל בגודל 71 מיליארד פרמטרים דורש שרתי GPU ייעודיים עם זיכרון וידאו גדול מאוד, בדרך כלל שני כרטיסי A100 או H100 של 80GB, כדי להחזיק את המודל ולייצר טוקנים בקצב סביר.

המפתחים שמרו על פורמט הפרומפט המקורי של לאמה 3 עם אותם טוקנים לסיום שיחה, כך שההטמעה בקוד קיים פשוטה. אם אין לכם תשתית ענן חזקה או צורך קשיח בפרטיות מידע מקומית, העלויות והתחזוקה של מפלצת כזו הופכות שימוש ב־API של מודל סגור לפתרון הגיוני בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="abacusai/Smaug-Llama-3-70B-Instruct")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון llama3 של חברת מטא. הרישיון מתיר שימוש מסחרי ומחקר, אך כפוף למגבלות המקוריות של מטא, כולל תנאי שימוש הוגן ומגבלת משתמשים חודשיים לחברות ענק. לפני שילוב במוצר מסחרי צריך לקרוא את תנאי הרישיון של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗