GPT
Q

Qwen2.5-Math-PRM-7B

קוד פתוח

Qwenother2025-01-13

  • transformers
  • safetensors
  • qwen2
  • feature-extraction
  • reward model

יש כאן גם סקירה על Qwen עצמו.

המודל הזה בודק צעד אחרי צעד פתרונות מתמטיים ונותן ציון לכל שלב בדרך. הוא מתאים למי שבונה מנגנוני חיפוש או סינון לתשובות של מודלים אחרים.

  • 7.6Bפרמטרים
  • 4,096טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 51,632הורדות בחודש

מה זה

מדובר במודל תגמול תהליכי, כלומר הוא לא מייצר טקסט חדש ולא פותר בעיות בעצמו, אלא מסווג טקסט קיים. הרעיון כאן הוא לבדוק את שלבי ההסקה בפתרון מתמטי ולזהות בדיוק באיזו שורה נפלה טעות, במקום להסתכל רק על התשובה הסופית בסוף התהליך.

הוא מבוסס על שבעה מיליארד פרמטרים ומשתמש בטוקן מיוחד שמכניסים אחרי כל שלב כדי לחשב הסתברות בין אפס לאחת לתקינות המהלך. לפי הנתונים שפורסמו, הוא הציג יכולת זיהוי שגיאות חזקה במבחן ProcessBench ושיפר בחירת תשובות בשיטת Best-of-N, מה שהופך אותו לרכיב ביקורת יעיל כשמריצים מודל גנרטיבי במקביל.

מתאים ל

  • סינון פתרונות בשיטת BoN

    דוגמים כמה תשובות שונות ממודל גנרטיבי ובוחרים את הפתרון שקיבל את הציון המצטבר הגבוה ביותר בכל שלב.

  • איתור שגיאות בחישוב

    מזינים פתרון שלם ומזהים בדיוק באיזה מעבר מתמטי נעשתה הטעות הראשונה לפי נפילת הניקוד.

  • בניית דאטהסטים לאימון

    מתן ציונים אוטומטי למיליוני שרשראות חשיבה כדי לסנן דוגמאות אימון גרועות לפני כוונון עדין.

איפה זה נופל

הוא מוגבל אך ורק לניתוח שלבי חשיבה במתמטיקה ובאנגלית או סינית. אין לו שום תמיכה בעברית, והוא לא מסוגל לכתוב פתרון בעצמו אלא רק לדרג טקסט שקיבל. חלון ההקשר עומד על 4,096 טוקנים, מה שאומר שהוכחות ארוכות במיוחד פשוט ייחתכו באמצע.

אותה משפחה

Qwen2.5-Math-PRM יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה יכול לפתור לי בעיות במתמטיקה מאפס?

לא. המשימה שלו היא סיווג בלבד, והוא לא פולט טקסט חופשי. אתם צריכים מודל אחר שייצר את הפתרון, והמודל הזה רק יבדוק אם השלבים נכונים.

אפשר להזין לו שאלות ופתרונות בעברית?

המודל אומן רק על אנגלית וסינית, ואין לו הבנה של מונחים מתמטיים בעברית. שימוש בטקסט מקומי יוביל לטעויות בדירוג או לחוסר הבנה של השלבים.

איך מריצים

המשקל יושב על 14.2 גיגה בייט בדיוק bfloat16, כך שצריך כרטיס מסך עם לפחות 16 גיגה זיכרון כדי לטעון אותו, כמו RTX 4090 או כרטיס שרת מקביל. אם מתכננים להריץ אותו יחד עם מודל שיוצר את הפתרונות עצמם, תצטרכו שרת עם כמה כרטיסים או לחלק את העבודה לשני שרתים נפרדים.

ההרצה מתבצעת דרך ספריית transformers מגרסה 4.40.0 ומעלה, ומחייבת הכנה מראש של הטקסט עם ירידות שורה כפולות בין שלב לשלב. אין פה נקודת קצה מנוהלת מוכנה מהקופסה, אז תצטרכו לנהל את השרת והזיכרון בעצמכם.

from transformers import pipeline

pipe = pipeline("text-classification", model="Qwen/Qwen2.5-Math-PRM-7B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כרגע כמשפחת other ולא כקוד פתוח סטנדרטי כמו אפאצ'י או MIT. זה אומר שחייבים לבדוק לעומק את תנאי השימוש המדויקים במסמכי הפרויקט לפני שמשלבים אותו במוצר מסחרי, כי אין כאן היתר מסחרי ברור ומובנה.

הרישיון המלא בעמוד המודל ↗