GPT
A

ArmoRM-Llama3-8B-v0.1

קוד פתוח

RLHFlowllama32024-05-23

  • transformers
  • safetensors
  • llama
  • text-classification
  • custom_code

זהו מודל תגמול שמדרג תשובות של טקסט לפי כמה מטרות במקביל. הוא עוקף במבחני דירוג מובילים אפילו שופטים שמבוססים על מודלים ענקיים.

  • 7.5Bפרמטרים
  • 8,192טוקנים בהקשר
  • 14.0 GBמשקל הקבצים
  • 14,186הורדות בחודש

מה זה

מדובר במודל שאינו מייצר טקסט בעצמו אלא שייך למשפחת מודלי התגמול. הוא נועד לקחת פרומפט ותשובה, לנתח אותם, ולתת ציון מספרי לאיכות הפלט. הבסיס שלו הוא מודל שמונה מיליארד פרמטרים שאומן מחדש על גבי FsfairX-LLaMA3-RM-v0.1, אך במקום להוציא ציון יחיד וסתמי הוא משלב מנגנון ניתוב עם שכבות מומחים שמחשב כמה יעדי תגמול שונים ומאחד אותם.

במבחן RewardBench הוא הגיע לציון כללי של 89.0 ועקף מערכות סגורות כמו מודל של Cohere ופסיקות של GPT-4 Turbo. החוזק האמיתי שלו מופיע בקטגוריות המורכבות יותר, עם 97.3 בהסקה לוגית ו־76.8 בשיחות קשות, שזה פער מורגש מול מודלים סטנדרטיים בגודל שלו שמגרדים שם את ה־65 נקודות בלבד.

מתאים ל

  • אימון RLHF למודלי שפה

    הוא מספק משוב מדויק ליישור מודלים בזכות התמחות בלוגיקה ובשיחות מורכבות.

  • סינון ודירוג של דאטה

    מתאים למיון תשובות סינתטיות לפני הזנה שלהן לאימון של מודל קצה.

  • בחירת התשובה הטובה ביותר

    מאפשר לייצר כמה תשובות במקביל ולבחור אוטומטית בזו שקיבלה את הציון הגבוה.

איפה זה נופל

למרות ההצלחה ברוב המבחנים, בקטגוריית Prior Sets המודל השיג 74.3 נקודות, תוצאה שנמוכה מזו של מודל הבסיס שממנו הוא נוצר. בנוסף, הארכיטקטורה הייעודית שלו, LlamaForRewardModelWithGating, מחייבת הרצה של קוד מותאם ולא מתאימה למנועי הסקה גנריים של יצירת טקסט.

שאלות
נפוצות

האם המודל הזה יכול לכתוב לי טקסט או קוד?

לא. המודל מוגדר למשימת סיווג ודירוג בלבד ולא מייצר מילים, אלא מחזיר ציון איכות לפלט שכבר קיים.

מה היתרון של מנגנון המומחים שמוטמע בו?

המנגנון מחלק את הערכת התשובה לכמה מדדים שונים, כמו בטיחות או היגיון, ומאחד אותם באופן גמיש בהתאם לסוג השאלה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך מודרני עם לפחות 16 עד 24 גיגה זיכרון גרפי, תלוי ברמת הדיוק שבה טוענים את המשקלים. הקבצים עצמם שוקלים 14 גיגה בפורמט המקורי, והוא נתמך ישירות בספריית transformers באמצעות ארכיטקטורה מותאמת אישית של דירוג עם שכבת ניתוב.

אם אתם צריכים לדרג כמויות קטנות של טקסט מדי פעם ולא רוצים להחזיק שרת דלוק, שימוש בפתרון ענן מרוחק יהיה זול בהרבה. המודל מתאים למי שבונה תהליך אימון של יישור מודלים או סינון דאטה בהיקפים גדולים, שבהם שליחת מיליוני בקשות לשירותי צד שלישי הופכת ליקרה ואיטית מדי.

from transformers import pipeline

pipe = pipeline("text-classification", model="RLHFlow/ArmoRM-Llama3-8B-v0.1")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama3 המקורי של מטא. הוא מאפשר שימוש מסחרי ומחקרי חופשי לרוב הפרויקטים, אך דורש עמידה במדיניות השימוש ההוגן של מטא ומחייב אישור מיוחד רק אם השירות שלכם חוצה מאות מיליוני משתמשים פעילים בחודש. אם אתם משלבים אותו במוצר פנימי או במערכת רגילה, אין מניעה חוקית לעשות זאת.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗