GPT
S

Skywork-Reward-Llama-3.1-8B-v0.2

קוד פתוח

Skyworkרישיון לא דווח2024-10-14

  • transformers
  • safetensors
  • llama
  • text-classification
  • text-embeddings-inference

מודל תיוג של שמונה מיליארד פרמטרים שמדרג איכות של תשובות טקסט לפי העדפות אנושיות. הוא נועד למי שמאמן מודלים בתהליכי חיזוק או בונה סינון אוטומטי לתשובות מובילות.

  • 7.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 14.0 GBמשקל הקבצים
  • 97,861הורדות בחודש

מה זה

במקום לייצר טקסט, המודל מקבל שיחה ומחזיר ציון מספרי שמייצג עד כמה התשובה טובה, בטוחה ומדויקת. הבסיס שלו הוא ארכיטקטורת Llama-3.1-8B-Instruct עם ראש סיווג רצף, שעבר אימון על אוסף של כ־80K זוגות העדפה ממקורות פתוחים כמו HelpSteer2, OffsetBias, WildGuard וסדרת Magpie. הנתונים סוננו כדי לוודא שאיכות הזוגות גבוהה ולחזק תחומים ספציפיים כמו קוד, מתמטיקה ובטיחות.

במבחן RewardBench מאוקטובר 2024, הוא קיבל ציון כללי של 93.1 והתייצב במקום הראשון בקטגוריית מודלי 8B. הוא השיג 96.7 בהסקה לוגית ו־94.7 בשיחה רגילה, תוצאות שמשתוות לדגמים כבדים בהרבה כמו SFR-LLaMa-3.1-70B-Judge-r שקיבל 92.7, מה שמוכיח שאוצרות נתונים קפדנית מפצה על כמות פרמטרים קטנה יותר.

מתאים ל

  • סינון תשובות בשיטת Best-of-N

    מייצרים כמה תשובות שונות ממודל גנרטיבי ומשתמשים בו כדי לבחור אוטומטית את התשובה עם הציון הגבוה ביותר.

  • אימון מודלים בחיזוק

    מתן ציוני תגמול מדויקים לחישובי אופטימיזציה של מודלי שפה, במיוחד במשימות הסקה מורכבות וקוד.

  • בקרת בטיחות לתשובות צ'אט

    סינון פלט פוגעני או מסוכן בזכות ציון בטיחות של 92.7 שנבדק על מאגר WildGuard מותאם.

איפה זה נופל

נקודת התורפה הבולטת במבחנים היא Chat Hard, שם הציון צונח ל־88.4, מה שמראה שהמודל מתקשה להבחין בין תשובות דומות ומורכבות כשההבדל דק. גרסת v0.1 הכילה דליפה של 4,957 זוגות בעלי חפיפה למבחן RewardBench, והגרסה הנוכחית מתקנת זאת, אבל מראה שהבנצ'מרק הראשוני היה מוטה.

בנוסף, היוצרים מצהירים שהם לא לוקחים אחריות על בעיות אבטחת מידע, הטעיות או שימוש לרעה שעלולים לקרות בעקבות שימוש במודל. אין בכרטיס שום התייחסות לביצועים בעברית, ומאחר שמקורות הנתונים היו באנגלית, המודל צפוי לתת ציונים לא יציבים לשפה המקומית.

שאלות
נפוצות

האם המודל הזה יודע לכתוב טקסט בעצמו?

לא. מדובר במודל סיווג רצף שמחזיר רק ציון מספרי על קלט נתון. אי אפשר להשתמש בו לייצור פסקאות או שיחה ישירה.

למה לבחור בגרסת v0.2 ולא בגרסה הראשונה?

גרסת v0.2 עברה ניקוי של 4,957 דגימות שהיו מזוהמות בחפיפה למבחן RewardBench. הרצה של הגרסה הקודמת תניב תוצאות בדיקה לא אמינות.

כמה זיכרון דרוש כדי לטעון אותו?

המשקלים תופסים 14.0 GB בזיכרון בפורמט bfloat16. בפועל דרוש כרטיס עם לפחות 16 ג'יגה זיכרון גרפי להרצה בסיסית, ויותר מכך לטקסטים ארוכים.

איך מריצים

המשקל הכולל של הקבצים עומד על 14.0 GB בפורמט bfloat16. כדי להעלות אותו לזיכרון ולבצע בדיקות בלי לחנוק את החומרה, תצטרכו כרטיס מסך עם לפחות 16 ג'יגה זיכרון גרפי, ועדיף כרטיס של 24 ג'יגה כדי לאפשר עיבוד של טקסטים ארוכים מתוך חלון ההקשר המלא של 131,072 טוקנים.

הריצה נעשית ישירות דרך ספריית transformers עם מחלקת סיווג רצף. גרסת v0.2 הזו מנקה זיהומים שהיו בגרסה הקודמת, ולכן חובה להעדיף אותה אם אתם מריצים השוואות מול בנצ'מרקים מוכרים. אם אתם צריכים את המודל רק לבדיקות מדגמיות של איכות תשובות פעם ביום, הקמת שרת ייעודי כבד עשויה להיות יקרה לעומת שימוש בשירות מנוהל.

from transformers import pipeline

pipe = pipeline("text-classification", model="Skywork/Skywork-Reward-Llama-3.1-8B-v0.2")
print(pipe("שלום"))

הרישיון

בעמוד המודל נכתב שלא דווח רישיון, אך בטקסט עצמו היוצרים מפנים להסכם בשם Skywork Community License ומצהירים כי שימוש מסחרי מותר בכפוף לתנאיו. לפני הטמעה בסביבת ייצור, חובה להוריד את קובץ הרישיון המקורי ולקרוא את ההגבלות המשפטיות שחלות עליו.

הרישיון המלא בעמוד המודל ↗