GPT
O

OpenHermes2.5-dpo-binarized-alpha

קוד פתוח

argillaרישיון לא דווח2024-02-02

  • synthetic
  • distilabel
  • rlaif
  • rlhf
  • dpo

גרסת אלפא לאימון העדפות שנבנתה על בסיס דגימה קטנה מתוך OpenHermes-2.5. היא מתאימה למי שמחפש זוגות של תשובה נבחרת ונדחית שנוצרו בקוד פתוח, בלי להסתמך על מודלים של OpenAI.

  • 83הורדות בחודש
  • 63לייקים

מה זה

המאגר מציג זוגות של תשובות בפורמט בינארי, כלומר שדה מועדף ושדה דחוי עבור כל הנחיה, כדי לאמן מודלים בשיטת DPO. הבסיס מגיע מדוגמאות של פנייה בודדת מתוך המאגר OpenHermes-2.5, שעובדו באמצעות ספריית distilabel.

כדי לייצר את ההשוואה, המפתחים הריצו את המודל Nous-Hermes-2-Yi-34B דרך vLLM כדי להפיק תשובה חדשה לכל קלט. לאחר מכן הם לא הניחו מראש מי מהתשובות טובה יותר, אלא השתמשו במודל הדירוג PairRM כדי להשוות בין התשובה המקורית לבין התשובה שנוצרה, ולקבוע מי מהן תוגדר כנבחרת ומי כנדחית. החלוקה במאגר כוללת שני חלקים נפרדים, אחד לאימון ואחד לבדיקה.

מתאים ל

  • אימון DPO בקוד פתוח

    התאמת מודלי שפה להעדפות אנושיות בלי תלות בדאטהסטים שנוצרו על ידי מודלים מסחריים סגורים.

  • ניסויי יישור מהירים

    בדיקת תהליכי אימון על מדגם קטן וממוקד לפני הרצה יקרה על מאגרים מלאים.

  • הערכת ביצועי PairRM

    בחינת איכות הבחירות של מודל התגמול מול התשובות המקוריות של OpenHermes.

איפה זה נופל

מדובר בגרסת אלפא מובהקת שנבנתה על מדגם קטן בלבד כדי לאסוף פידבק, כך שאין כאן כיסוי מלא של הדאטהסט המקורי. הסינון והדירוג מבוססים לחלוטין על מודל אוטומטי, PairRM, ללא בקרת איכות אנושית מדווחת, מה שאומר שהטיות של מודל הדירוג נכנסו ישירות לתוצאה. בנוסף, המאגר מוגבל לפנייה בודדת בלבד ואין בו שום תיעוד לתמיכה בעברית, כך שלא הייתי בונה עליו התאמה לשפה המקומית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא כדאי להסתמך עליו כרגע. בעמוד המאגר לא צוין רישיון, ובמצב כזה אין אישור משפטי מפורש לשימוש מסחרי בנתונים או במודלים שיאומנו עליהם.

האם הדאטהסט כולל תוכן בעברית?

אין לכך אזכור בתיעוד. המאגר מבוסס על OpenHermes-2.5 שרובו המוחלט באנגלית, ולכן אינו מתאים למי שמחפש נתוני אימון בעברית.

איך נאספו התשובות ונבחרו ההעדפות?

ההנחיות נלקחו מהמאגר OpenHermes-2.5 עבור פניות בודדות, ועבורן נוצרה תשובה נוספת באמצעות המודל Nous-Hermes-2-Yi-34B. לאחר מכן מודל PairRM דירג איזו תשובה עדיפה, והיא נקבעה כבחירה הטובה מבין השתיים.

מה ההבדל בין המאגר הזה ל־OpenHermes המקורי?

המאגר המקורי כולל שיחות להוראות כלליות. הגרסה הזו לוקחת רק דגימה קטנה ממנו, מייצרת עבורה חלופות, ומסדרת אותן כזוגות של תשובה טובה מול פחות טובה לצורך אימון DPO.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם השם argilla/openhermes2.5-dpo-binarized-alpha, ללא צורך באישור גישה מיוחד. הקבצים יושבים בפורמט Parquet המחולק לתיקיות train ו־test. השדות המרכזיים שמעניינים אתכם הם chosen ו־rejected, שכוללים את רצף השיחה. לפני שמזינים אותם לאימון, צריך להמיר את השיחות לפורמט הפרומפטים שמתאים לטוקנייזר שלכם, למשל ChatML, באמצעות חילוץ ההנחיה והתשובות מתוך הרשימות.

from datasets import load_dataset

ds = load_dataset("argilla/OpenHermes2.5-dpo-binarized-alpha")

הרישיון

למאגר לא דווח רישיון כלל. מבחינה משפטית, כשאין רישיון מוגדר אין לכם הרשאה ברורה להשתמש בנתונים, בטח שלא לאימון מודלים לשימוש מסחרי בחברה. אם אתם שוקלים להכניס את זה למוצר, אתם לוקחים סיכון זכויות יוצרים עד שהיוצרים יבהירו את תנאי ההפצה.

הרישיון המלא ב־Hugging Face ↗