GPT
R

Rhea-72b-v0.5

קוד פתוח

davidkim205apache-2.02024-03-22

  • transformers
  • safetensors
  • llama
  • text-generation
  • en

גרסת פיין טיונינג של שבעים ושניים מיליארד פרמטרים, שמכוונת בעיקר לביצועים חזקים במבחני שפה סטנדרטיים באנגלית. המפתח ייצר דאטה מבוסס טעויות פנימיות כדי לעקוף מודלים פתוחים אחרים.

  • 72Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 8,465הורדות בחודש

מה זה

המודל הזה נשען על Smaug 72B ועבר סבב אימון נוסף בשיטות SFT ואימון העדפות מסוג DPO. הרעיון כאן היה לבנות סט אימון של העדפות ישירות מתוך טעויות שהמודל עצמו פלט מול תשובות נכונות, וכך לתקן סטיות וניסוחים חלשים בלי להסתמך רק על פידבק אנושי.

במבחני הביצועים של Open LLM Leaderboard הוא הגיע לממוצע של 81.22 נקודות, כולל 91.15 בבדיקת HellaSwag וקרוב לשישים ושמונה אחוזים בבדיקות מתמטיקה כמו GSM8k. המספרים האלה מראים שהוא טוב מאוד בלפתור שאלות רב ברירה, בהיגיון מובנה ובהבנת טקסט מורכב באנגלית, אבל הם לא מעידים בהכרח על שיחה שוטפת שמרגישה טבעית במוצר חי.

מתאים ל

  • פתרון בעיות היגיון מורכבות

    התוצאות הגבוהות בבדיקות כמו ARC ו־HellaSwag הופכות אותו למתאים לעיבוד שאלות הדורשות הסקת מסקנות באנגלית.

  • חילוץ מידע מטקסטים טכניים

    הוא אומן על מאגרי שאלות ותשובות רבים ומתמודד היטב עם ניתוח מסמכים ארוכים באנגלית עד 32,768 טוקנים.

  • פתרון תרגילים וקוד באנגלית

    ציונים של מעל 76 אחוז במבחני GSM8k מתאימים למשימות של שלבי חישוב עוקבים ובדיקת שגיאות לוגיות.

איפה זה נופל

האימון נעשה כולו באנגלית ובלי שום התאמה מכוונת לעברית. אם תנסו לתחקר אותו בעברית הוא כנראה יענה לאט, יתרגם בראש וייפול בתחביר בסיסי. מעבר לזה, חלק ממאגרי האימון של המפתח סגורים ולא פורסמו, כך שאי אפשר לדעת בדיוק אילו הטיות נכנסו פנימה. מיקוד היתר בהשגת ציונים במבחנים גם מעלה חשד סביר לאוברפיטינג על מבנה השאלות של הלידרבורד.

שאלות
נפוצות

האם המודל מתאים למוצרים שפונים לקהל ישראלי?

לא באופן ישיר. המודל מתועד ומאומן באנגלית בלבד, וכל המאגרים ששימשו לכיוונון שלו היו באנגלית. כדי לעבוד איתו בעברית תצטרכו להשקיע בעבודה מקדימה של תרגום או לבצע עליו אימון נוסף.

איך המודל הגיע למקום הראשון בדירוג?

המפתח השתמש בשיטה של ייצור דאטה עצמי מטעויות של המודל מול תשובות נכונות, ואז אימן אותו עם DPO על הנקודות החלשות. השיטה הזו מכוונת ישירות לשפר את הציונים במבחנים הספציפיים שנבדקים בלידרבורד.

איך מריצים

כדי להריץ 135 ג'יגה בייט של משקלים ברמת דיוק bfloat16, צריך לפחות שני כרטיסי A100 או H100 של 80GB רק כדי לטעון אותו לזיכרון לפני שבכלל שלחתם טוקן אחד. אפשר לכווץ אותו בקוונטיזציה כדי לדחוס אותו לחומרה צנועה יותר, אבל עדיין תצטרכו שרת ייעודי כבד.

אם אין לכם אשכול שרתים מקומי או תקציב ענן שמצדיק החזקת מכונות כאלה דולקות, עדיף להשתמש בנקודות קצה של ספקי API שמציעים מודלים בגודל הזה לפי שימוש, במקום לשלם על ברזלים שלא מנוצלים במאה אחוז מהזמן.

from transformers import pipeline

pipe = pipeline("text-generation", model="davidkim205/Rhea-72b-v0.5")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מלא. אתם יכולים להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו אצלכם ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים. התנאי העיקרי הוא להשאיר את הצהרת זכויות היוצרים ואת נוסח הרישיון המקורי בקבצים שתפיצו הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗