GPT
L

Llama-3-Smaug-8B

קוד פתוח

abacusaillama22024-04-19

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

גרסת כוונון עדין למודל שמונה מיליארד פרמטרים שמנסה לשפר שיחות מורכבות. מי שיבחר בו מחפש תשובה ראשונית חדה יותר מהמקור הרשמי בלי להגדיל את צריכת הזיכרון.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 8,524הורדות בחודש

מה זה

מדובר בכוונון עדין של Abacus.AI על בסיס מודל ההוראות של מטא, תוך שימוש בשיטה שהם מכנים Smaug. הרעיון כאן הוא לקחת בסיס קיים ומוכר ולהוציא ממנו יותר בשיחות מרובות שלבים בעולם האמיתי, עם נתונים וטכניקות חדשות שלא היו בגרסאות קודמות שלהם.

במדד MT-Bench המודל מציג ממוצע של 8.33 לעומת 8.10 של מודל המקור. ההבדל כולו מגיע מהאינטראקציה הראשונה, שבה הוא מזנק לציון 8.78 לעומת 8.31, בעוד שבסיבוב השני שני המודלים נעצרים בדיוק על אותו ציון של 7.89. בפועל זה אומר שעיקר השיפור מורגש ביכולת להבין את ההנחיה הראשונית ולספק מענה מדויק ישר מהפתיחה, אבל אין כאן יתרון מוכח בהמשך הדיאלוג.

מתאים ל

  • מענה ראשוני לשאלות משתמש

    הציון שלו בפנייה הראשונה גבוה משמעותית ממודל הבסיס ומתאים לטיפול ישיר בפניות נכנסות.

  • סוכן שיחה פשוט בשרת מקומי

    הגודל שלו מתאים להרצה על כרטיס בודד של 24 גיגה בלי לשלם על מודלים ענקיים.

  • שכתוב והבנת הנחיות

    הוא ממוקד בשיפור איכות המענה הראשוני לבקשות מנוסחות היטב.

איפה זה נופל

היוצרים מציגים מדד אחד בלבד, MT-Bench, ואין שום מידע על ביצועים במשימות קוד, ידע כללי או מתמטיקה. מעבר לזה, היתרון נעלם לגמרי בפנייה השנייה באותו דיאלוג, שבה הוא מקבל ציון זהה למקור. אין עדיין תיעוד מלא על הדאטה החדש שבו השתמשו, ולכן אי אפשר לדעת מראש איך הוא מתנהג בשפות שאינן אנגלית או בתחומים מקצועיים צרים.

שאלות
נפוצות

האם הוא באמת טוב יותר ממודל הבסיס הרשמי?

הוא מציג יתרון ברור רק בפנייה הראשונה בבדיקה, שם הוא מקבל ציון גבוה יותר. ברגע שהשיחה ממשיכה לסיבוב שני, הביצועים שלו זהים לחלוטין למקור לפי המדידות שלהם.

האם המודל תומך היטב בעברית?

כרטיס המודל לא מפרט נתונים על שפות מעבר לבסיס שעליו הוא אומן. מודל המקור יודע עברית בסיסית אך מוגבלת, ואין אינדיקציה שהכוונון הנוכחי שיפר את התחום הזה.

איך מריצים

המשקל עומד על 15 גיגה בייט בפורמט bfloat16, כך שצריך כרטיס מסך עם לפחות 24 גיגה זיכרון כדי להריץ אותו בנוחות בלי קוונטיזציה. מי שמחזיק חומרה צנועה יותר יצטרך לצמצם אותו לגרסאות 4 או 8 ביט כדי לדחוס אותו לכרטיסים שולחניים קטנים יותר.

אם אין לכם שרת ייעודי עם מעבד גרפי מתאים, להחזיק תשתית דולקת רק בשביל מודל של שמונה מיליארד זה עסק יקר. במקרה שאתם לא מחויבים לפרטיות מוחלטת של הנתונים, שליחת בקשות לפתרונות ענן מנוהלים תהיה פשוטה וזולה בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="abacusai/Llama-3-Smaug-8B")
print(pipe("שלום"))

הרישיון

המטאדאטה מציין רישיון llama2 בעוד שבטקסט מפנים לתנאי השימוש של Llama 3. הבלבול הזה דורש בדיקה משפטית לפני שמטמיעים אותו, אך לפי תנאי Llama 3 השימוש המסחרי מותר בחינם כל עוד המוצר שלכם לא משרת מאות מיליוני משתמשים פעילים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗