GPT
Q

Qwen2.5-Math-RM-72B

קוד פתוח

Qwenother2024-09-17

  • transformers
  • safetensors
  • qwen2
  • feature-extraction
  • reward model

יש כאן גם סקירה על Qwen עצמו.

מודל תגמול ענק שמיועד לדרג פתרונות מתמטיים מורכבים באנגלית ובסינית. הוא לא כותב תשובות בעצמו, אלא בורר את התשובה הנכונה ביותר מתוך כמה אפשרויות.

  • 73Bפרמטרים
  • 4,096טוקנים בהקשר
  • 136 GBמשקל הקבצים
  • 26,338הורדות בחודש

מה זה

מדובר במודל ששוקל 73 מיליארד פרמטרים ומבוסס על ארכיטקטורת סיווג, לא יצירת טקסט. התפקיד שלו הוא לקבל פתרון של בעיה מתמטית, כולל שלבי ביניים בשרשרת מחשבה או שימוש בכלים, ולתת לו ציון איכות.

הוא מיועד לאימון מודלים אחרים בלמידת חיזוק, לסינון דאטה בשיטת דגימת דחייה, או לסינון בזמן ריצה בשיטת Best of N. לפי המפתחים, סינון תשובות של מודל קטן בן 1.5 מיליארד פרמטרים בעזרת מודל התגמול הזה הביא לציון 83.9 במבחן MATH, ועקף מודל של 7 מיליארד פרמטרים בריצה רגילה. הדירוג שלו הציג ביצועים עדיפים על הצבעת רוב פשוטה.

מתאים ל

  • אימון בלמידת חיזוק

    מתן אותות תגמול מדויקים למודלים אחרים שמתאמנים על פתרון בעיות מתמטיות.

  • סינון דאטה בסיבוב מוקדם

    ניקוי ודירוג מאגרי שאלות ותשובות לפני אימון בעזרת דגימת דחייה.

  • בחירת פתרון ב־Best of N

    דגימת כמה תשובות שונות ממודל קל ובחירת הפתרון הטוב ביותר לפי הציון.

איפה זה נופל

הוא יודע רק אנגלית וסינית, וחלון ההקשר שלו מוגבל ל־4,096 טוקנים בלבד. אם תזינו לו שאלה בעברית או הוכחה ארוכה שחורגת מהחלון, הוא לא ידע מה לעשות איתה. בנוסף, הוא לא פותר תרגילים ולא מייצר טקסט חדש, כך שאם מחפשים מודל שיענה למשתמשים בצ'אט, זה לא הכלי.

שאלות
נפוצות

אפשר להשתמש בו כדי לענות לתלמידים על שאלות במתמטיקה?

לא ישירות. המודל רק נותן ציונים לתשובות קיימות ולא מייצר טקסט חדש, כך שתצטרכו מודל גנרטיבי נפרד שיכתוב את הפתרון ורק אז להעביר אותו לכאן לבדיקה.

הוא תומך בשאלות מתמטיקה בעברית?

לא. המודל אומן ותומך רשמית בשתי שפות בלבד, אנגלית וסינית, ואין לו תמיכה בטקסטים בעברית.

איך מריצים

כדי להריץ אותו צריך transformers בגרסה 4.40.0 ומעלה. הקבצים שוקלים 136 גיגה בייטים בדיוק של bfloat16, כך שתצטרכו שרת עם לפחות שני כרטיסי A100 או H100 של 80 גיגה כדי רק לטעון אותו לזיכרון.

אם אתם לא מאמנים מודלים מאפס או בונים מערכת שמייצרת עשרות תשובות במקביל ובודקת אותן, אין שום סיבה להחזיק מפלצת כזאת בשרת פרטי. העלויות של החומרה הזו פשוט לא מוצדקות לשימוש שאינו מחקרי או תעשייתי כבד.

from transformers import pipeline

pipe = pipeline("text-classification", model="Qwen/Qwen2.5-Math-RM-72B")
print(pipe("שלום"))

הקבצים

50 קבצים במאגר, 136 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר בתור other ולא כרישיון קוד פתוח סטנדרטי. במצב כזה אי אפשר להניח שמותר להשתמש בו במוצר מסחרי בלי לקרוא לעומק את תנאי השימוש שהמפתחים צירפו בריפו.

הרישיון המלא בעמוד המודל ↗