GPT
L

Llama3.1-8B-PRM-Deepseek-Data

קוד פתוח

RLHFlowרישיון לא דווח2024-11-08

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

זהו מודל תגמול שלבי שבודק פתרונות מתמטיים צעד אחר צעד. מפתחים משתמשים בו כדי לדרג מסלולי חשיבה ולסנן שגיאות חישוב של מודלים אחרים.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 15,844הורדות בחודש

מה זה

הפרויקט הזה לוקח את הבסיס של Llama 3.1 8B ומאמן אותו לשמש כמודל תגמול שלבי, Process Reward Model. במקום לשפוט רק את התוצאה הסופית של תרגיל, הוא בוחן כל שלב בפתרון בנפרד. האימון נשען על דאטהסט של דיפסיק ועבר אפוק אחד עם דגימות באורך 8192 טוקנים.

בבדיקות של החוקרים על מחוללים כמו מיסטרל ודיפסיק, שימוש בסינון שלבי כזה הקפיץ את התוצאות במבחנים מתמטיים מורכבים כמו MATH מציון בסיסי של 38.4 לציון של 58.1 בבחירה מתוך 1024 דגימות. זה מראה שהערכת צעדים עוזרת לחלץ תשובות נכונות גם כשהמודל המייצר נוטה לטעות בדרך.

מתאים ל

  • דירוג פתרונות מתמטיים

    הוא מזהה איזה צעד בחישוב היה שגוי ומדרג עשרות תשובות שנפלטו ממודל אחר.

  • אימון מודלים בשיטת RLHF

    הוא מספק משוב שלבי ומדויק לתהליכי שיפור של מודלים פתוחים אחרים.

  • סינון תשובות בהסקה

    עוזר לבחור את המסלול הנכון מתוך דגימות מרובות של מחוללי קוד ומתמטיקה.

איפה זה נופל

המודל הזה לא נועד לכתוב טקסט חופשי, לא יודע לנהל שיחה, ואין שום מידע על היכולות שלו בעברית. כל הבדיקות שלו נעשו על מתמטיקה באנגלית דרך מדדים כמו GSM8K ו־MATH. אם תנסו לתת לו לפתור בעיות מחוץ לעולם המתמטי וההסקה הלוגית, אין שום ערובה שהוא יחזיר ציונים הגיוניים.

שאלות
נפוצות

האם המודל יכול לענות לי על שאלות מתמטיקה ישירות?

לא, הוא משמש כמעריך ולא כמחולל רגיל. התפקיד שלו הוא לקבל פתרון קיים ולתת ציון לכל שלב בדרך לתוצאה.

האם הוא יעבוד טוב עם טקסט בעברית?

הכרטיס לא מציין תמיכה בעברית והאימון התמקד בדאטהסט מתמטי באנגלית. סביר מאוד שהוא יתקשה לנתח הסברים בעברית.

איך מריצים

כדי להריץ אותו בפורמט bfloat16 תצטרכו כרטיס מסך יחיד עם 24 גיגה זיכרון, למשל RTX 3090 או A10G, שמחזיק בנוחות קבצים של 15 גיגה. הקוד נשען על ספריית transformers הסטנדרטית, והדוגמאות המלאות להרצה נמצאות בריפו של הפרויקט.

אם אתם רק רוצים לבדוק צעדים בודדים מדי פעם, החזקה של שרת ייעודי כזה תעלה לא מעט ולא בטוח תצדיק את עצמה מול שירותי ענן לפי שימוש. הוא משתלם בעיקר למי שמריץ פייפליין מקומי של דגימה מרובה ודירוג.

from transformers import pipeline

pipe = pipeline("text-generation", model="RLHFlow/Llama3.1-8B-PRM-Deepseek-Data")
print(pipe("שלום"))

הרישיון

היוצרים לא הגדירו רישיון בדף המודל. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת מראש אם מותר לשלב אותו במוצר בלי להסתכן. גופים מסחריים יצטרכו לבדוק את הרישיונות של מודל הבסיס ושל הדאטהסט של דיפסיק כדי להבין את המעמד המשפטי.

הרישיון המלא בעמוד המודל ↗