GPT
P

PairRM

קוד פתוח

llm-blendermit2023-11-06

  • transformers
  • safetensors
  • deberta
  • reward_model
  • reward-model

במקום לייצר טקסט, המודל הזה משווה בין שתי תשובות שונות וקובע מי מהן מוצלחת יותר. הוא שוקל מעט מאוד ומספק שופט מהיר שרץ ישירות על החומרה שלכם.

  • 436Mפרמטרים
  • 1.6 GBמשקל הקבצים
  • 605הורדות בחודש
  • 209לייקים

מה זה

המודל מבוסס על deberta-v3-large וכולל כ־436 מיליון פרמטרים. במקום לבדוק כל פלט בנפרד ולתת לו ציון מנותק, הוא מקבל את הפרומפט המקורי ואת שני המועמדים יחד, ובאמצעות תשומת לב דו־כיוונית בוחן את ההבדלים הדקים ביניהם ראש בראש. שיטת ההשוואה הזו מאפשרת לדרג רשימות פלטים לצורך דגימת best-of-n או עבור תהליכי RLHF, בלי להחזיק מודל ענק ברקע.

במבחני ביצועים מול העדפות אנושיות, המודל עוקף מודלים פתוחים גדולים בהרבה. במבחן Auto-J הוא הגיע לדיוק כולל של 59.05%, מעל מודלים כמו LLaMA-2-chat-70B שעצר על 45.9%, ומאוד קרוב ל־UltraRM שדורש 13 מיליארד פרמטרים. במבחן MT-bench מול שיפוט אנושי הוא השיג התאמה של 59%, ציון שעוקף גם את GPT-3.5-turbo ומגרד את GPT-4 מלמטה, למרות פער הגדלים העצום ביניהם.

מתאים ל

  • סינון best-of-n בזמן אמת

    דגימת כמה תשובות ממודל יוצר ובחירת הפלט הטוב ביותר בהשהיה נמוכה.

  • אימון ויישור מודלים ב־RLHF

    חיבור ישיר לספריות כמו trl כדי לתת משוב השוואתי על מועמדים בלי להסתמך על API חיצוני.

  • הערכת איכות מקומית ל־LLM

    בדיקת איכות של מודלים שונים על דאטה פנימי בלי להוציא נתונים לרשת.

איפה זה נופל

מגבלת ההקשר הכוללת היא 2048 תווכים, מתוכם 1224 לטקסט המקור ו־412 בלבד לכל אחת מהתשובות המועמדות. אם התשובות שלכם ארוכות ומפורטות, הוא יחתוך אותן ולא יוכל לשפוט את החלקים החסרים. בנוסף, המודל אומן כולו באנגלית על בסיסי נתונים כמו UltraFeedback ו־Anthropic hh-rlhf, כך שאין שום עדות ליכולת שיפוט אמינה בעברית.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לכתוב טקסט?

לא. למרות שהמשימה הרשומה היא יצירת טקסט, המודל הזה מתפקד רק כשופט שמקבל שתי תשובות וקובע מי עדיפה. הוא לא יודע לייצר תשובה לפרומפט בעצמו.

איך הוא מתמודד עם טקסטים ארוכים?

הוא מוגבל מאוד באורך הפלט. המודל מקצה עד 412 תווכים לכל מועמד, ולכן פלטים ארוכים כמו מאמרים או קוד מורכב ייחתכו ולא יישפטו כראוי.

איך מריצים

כדי להריץ אותו מתקינים את חבילת llm-blender ישירות ממאגר הגיטהאב שלהם וטוענים את המודל בפייתון. קבצי המשקולות שוקלים סך הכול 1.6 גיגה־בייט, כך שהוא נכנס בקלות לזיכרון של כל כרטיס מסך בסיסי, ורץ ללא בעיה גם על מעבד רגיל של שרת או מחשב פיתוח מקומי.

אין כאן מספר גרסאות שונות לבחור ביניהן. שווה להחזיק אותו מקומית אם אתם דוגמים עשרות תשובות בזמן אמת וצריכים לסנן אותן באלפיות שנייה, כי פנייה ל־API חיצוני כמו שיפוט של GPT-4 תייצר השהיה כבדה ותעלה הון בכל קריאה.

from transformers import pipeline

pipe = pipeline("text-generation", model="llm-blender/PairRM")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון MIT, שזה הרישיון הכי מתירני שיש. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור ולהפיץ אותו ללא תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗