GPT
S

Skywork-Reward-V2-Llama-3.1-8B

קוד פתוח

Skyworkllama3.12025-06-26

  • transformers
  • safetensors
  • llama
  • text-classification
  • text-embeddings-inference

מודל תגמול שמדרג תשובות של מודלי שפה, מבוסס על לאמה 3.1 ומציג תוצאות חריגות במבחני השוואה. תרצו אותו כדי לבחור את הפלט המוביל או לאמן מודלים אחרים בחיזוק.

  • 7.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 14.0 GBמשקל הקבצים
  • 8,883הורדות בחודש

מה זה

זהו מודל סיווג מסוג בראדלי טרי, שנבנה על בסיס לאמה 3.1 בהיקף 8 מיליארד פרמטרים ואומן על 26 מיליון זוגות העדפה. תפקידו אינו לייצר טקסט חופשי, אלא לקבל שיחה ולהחזיר ציון מספרי שמשקף את איכות התשובה.

במדדי ההערכה המקובלים לתחום הוא עוקף מודלים גדולים ממנו בהרבה. במבחן RewardBench v1 הוא מקבל ציון 96.4, ובגרסה v2 ציון 84.1, כאשר הממוצע שלו בכל שבעת המבחנים עומד על 85.8. המספרים האלה מציבים אותו מעל מודלים גנרטיביים מבוססי קלוד ו־GPT-4o במבחני שופט, וברמה הגבוהה ביותר מבין מודלי תגמול זמינים בגודל הזה.

מתאים ל

  • סינון תשובות בזמן אמת

    דירוג מספר פלטים של מודל יוצר כדי להציג למשתמש רק את התשובה עם הציון הגבוה ביותר.

  • אימון במודל חיזוק

    מתן ציוני משוב לשלבי אופטימיזציה בתהליכי RLHF לשיפור מודלי שיחה מקומיים.

  • ניקוי דאטה סינתטי

    סינון זוגות שאלה ותשובה באיכות נמוכה מתוך מאגרי נתונים לפני אימון מודלים חדשים.

איפה זה נופל

למרות שהארכיטקטורה תומכת ב־131,072 טוקנים, המודל אומן על נתונים באורך מרבי של 16,384 טוקנים בלבד. מעבר לטווח הזה הדיוק שלו לא מובטח. בנוסף, אסור לשלב בו פרומפט מערכת בתבנית השיחה, שכן הוא אינו מכיר את המבנה הזה ועלול לספק ציונים מעוותים.

שאלות
נפוצות

האם המודל יכול לכתוב תשובות למשתמשים?

לא. זהו מודל סיווג שמחזיר ציון מספרי בלבד עבור טקסט קיים. הוא מיועד לדרג תשובות ולא לייצר אותן.

האם כדאי להשתמש בגרסת ה־40M שמציגה ציונים גבוהים יותר?

לא במוצר פעיל. היוצרים מצהירים במפורש שמדובר בגרסה ניסיונית למחקר, אשר אומנה עם דאטה הפוך בחלקו, ולכן גרסת ה־8B הרגילה מומלצת לייצור.

איך מריצים

המשקל הכולל של הקבצים עומד על 14 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך בודד עם 24 גיגה זיכרון כדי לטעון אותו, או כמה כרטיסים אם מריצים חישובים במקביל. אפשר לטעון אותו ישירות דרך ספריית transformers למשימות נקודתיות.

לעבודה בסקייל של מיליוני שיחות, היוצרים ממליצים להשתמש בשרתי SGLang עם הדגל is-embedding וחלון קונטקסט מוגדר. אם יש לכם צורך זמני בכמה אלפי דירוגים ולא שרת ייעודי, החזקת חומרה כזו עשויה להיות יקרה ועדיף לבדוק פתרונות ענן לפי שימוש.

from transformers import pipeline

pipe = pipeline("text-classification", model="Skywork/Skywork-Reward-V2-Llama-3.1-8B")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה של לאמה 3.1 מבית מטא. הוא מאפשר שימוש מסחרי חופשי כל עוד אין לכם מעל 700 מיליון משתמשים פעילים בחודש, ובתנאי שאתם שומרים על תנאי השימוש המקוריים ומציינים את המקור.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗