GPT
L

Llama3-TenyxChat-70B

קוד פתוח

tenyxllama32024-04-26

  • transformers
  • safetensors
  • llama
  • text-generation
  • tenyx-fine-tuning

גרסת כוונון עדין של Llama 3 70B שמיועדת לשיחות מרובות שלבים. היא מציגה ביצועים משופרים במבחני צ'אט בלי לאבד יכולות כלליות של מודל הבסיס.

  • 71Bפרמטרים
  • 8,192טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 8,326הורדות בחודש

מה זה

החברה לקחה את Llama 3 70B Instruct ואימנה אותו בשיטת DPO על מאגר המשוב UltraFeedback, במטרה למנוע שכחה של ידע קודם בזמן התאמה להעדפות שיחה. הרעיון הוא לתת פתרון לבעיה מוכרת שבה אימון נוסף משפר מדד אחד אבל פוגע באחרים.

במבחני MT-Bench המודל קיבל ציון 8.15 מול 7.96 של מודל המקור, עם יתרון ברור בשיחות שנמשכות מעבר לשאלה הראשונה. במבחן Arena Hard הוא הגיע לציון 49.0 לעומת 47.3 של גרסת ההוראות המקורית, ובמדדי הלידרבורד הכללי הוא רשם עלייה קלה ברוב המבחנים כולל קפיצה ב־GSM8K.

מתאים ל

  • בוט שיחה מרובה שלבים

    שומר על איכות מענה טובה גם בסיבוב השני של השיחה בלי לסטות מההקשר.

  • עיבוד טקסטים באנגלית

    מציג ציונים משופרים במדדי הבנה וחילוץ מידע על גבי 8,192 טוקנים.

  • עוזר פנימי לחברות

    מתאים לארגונים שמחזיקים שרתי GPU ומחפשים ביצועי שיחה חזקים בקוד פתוח.

איפה זה נופל

היוצרים מצהירים במפורש שהם לא ביצעו אימון בטיחות ייעודי מול העדפות אנושיות, כך שהמודל עלול לפלוט תוכן בעייתי תחת פרומפטים עוינים. בנוסף, הוא עדיין מתקשה במשימות שדורשות היגיון עמוק ומתמטיקה, ונוטה לפעמים לייצר תשובות ארוכות מדי או לכלול מידע מיותר. תמיכת השפה המדווחת היא אנגלית בלבד, ולכן יישום בעברית דורש בדיקה מקיפה שלכם לפני כל שילוב במערכת פעילה.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

הכרטיס מדווח על אנגלית בלבד כשפת עבודה רשמית. הבסיס של מטא כולל יכולות מסוימות בשפות נוספות, אבל לא נעשה כאן כוונון ייעודי לעברית ולכן התוצאות עלולות להיות מוגבלות.

מה ההבדל בינו לבין Llama 3 70B Instruct הרגיל?

הוא עבר אופטימיזציה נוספת להתאמה להעדפות משתמש שמחזקת את היציבות בשיחות מתמשכות. המדדים מראים שיפור קל ברוב המבחנים בלי הירידה בביצועים שמאפיינת כוונונים אחרים ברשת.

איך מריצים

כדי לטעון את 131 הג'יגה בייט של המשקולות בדיוק המקורי של bfloat16 דרוש שרת עם לפחות שני כרטיסי A100 או H100 של 80GB, או מערך מרובה כרטיסים קטנים יותר עם קוונטיזציה. המודל משתמש באותו Chat Template סטנדרטי של Llama 3, כך שאפשר להריץ אותו ישר בספריית transformers או בשרתי הסקה ייעודיים.

אם אין לכם תשתית ענן ייעודית שפועלת ברציפות, העלות השעתית של החומרה הזו הופכת הרצה עצמית ללא משתלמת. במקרים כאלה עדיף לגשת למודלים מקבילים דרך API מסחרי ולשלם לפי טוקנים בלבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="tenyx/Llama3-TenyxChat-70B")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הקהילתי של Meta Llama 3. מותר להשתמש בו לצרכים מסחריים ומחקריים, בתנאי שהמוצר שלכם לא חורג מ־700 מיליון משתמשים פעילים בחודש במועד השחרור, שאז נדרש אישור מיוחד ממטא. כמו כן חובה להוסיף ייחוס ל־Llama 3 בהתאם לתנאי הרישיון.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗