GPT
O

OpenHermes-2.5

קוד פתוח

tekniumרישיון לא דווח2023-11-12

  • synthetic
  • GPT-4
  • Distillation
  • Compilation

אוסף של כמיליון שיחות והוראות שנוצרו ברובן באופן סינתטי. הוא מרכז פלטפורמות מקור מובילות לאימון מודלים שמיועדים לעקוב אחרי הנחיות ולנהל שיחה.

  • 33,209הורדות בחודש
  • 901לייקים

מה זה

המאגר מכיל כמיליון רשומות המבוססות על מבנה שיחה רב שלבי של ShareGPT. כל רשומה כוללת מערך של חילופי דברים עם הגדרת התפקיד כמו מערכת, משתמש ומודל, יחד עם תוכן ההודעה עצמה. חלק מהרשומות מגיעות גם עם מטא דאטה שמציין את קטגוריית התוכן ואת המקור הספציפי שממנו נלקחה הדוגמה.

התוכן נאסף משורה ארוכה של מאגרי קוד פתוח מוכרים ומערכי נתונים סינתטיים מותאמים. בין המקורות תמצאו את SlimOrca שכולל 550 אלף דוגמאות, Evol Instruct, Glaive Code Assistant לקוד, MetaMath ונתוני מומחה של CamelAI למתמטיקה ומדעים, משימות רפואיות של CogStack, ודאטהסטים מבוססי GPT-4 כמו ShareGPT ו־ChatBot Arena. היוצר לא פירט על תהליך סינון שיטתי מעבר לאיסוף ולחיבור המקורות.

מתאים ל

  • אימון מודל שיחה כללי

    כוונון עדין של מודלי בסיס באנגלית למענה להוראות ושיחה במגוון תחומים רחב.

  • שיפור יכולות קוד ומתמטיקה

    שימוש בתת המאגרים של Glaive ו־MetaMath לאימון מודלים על פתרון בעיות חישוביות.

  • חקירת דאטה סינתטי

    ניתוח ואשכול של שיחות סינתטיות באמצעות סביבות מחקר כמו Lilac.

איפה זה נופל

המאגר מוגדר כולו באנגלית ואין בו נתונים בעברית, כך שהוא לא יעזור לאימון ישיר על שפת היעד המקומית. רוב הדאטה מבוסס על פלטים סינתטיים של מודלים כמו GPT-4, מה שאומר שהטיות, הזיות וטעויות היגיון של מודל המקור זלגו פנימה. היוצר עצמו מציין שאיבד את דף המקור של CoT Alpaca GPT4, ולא מפורטים תהליכי דה-דופליקציה או בדיקות רעילות.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא מומלץ להסתמך עליו מסחרית בלי בדיקה משפטית. המאגר פורסם ללא רישיון כלל, ובנוסף הוא כולל פלטים רבים שנוצרו על ידי GPT-4, דבר שמפר את תנאי השימוש של יוצרי המקור למטרות אימון מתחרה.

האם יש במאגר תמיכה בשפה העברית?

לא. שפת המאגר המוגדרת היא אנגלית בלבד, וכל הדוגמאות והשיחות בו מבוססות על מקורות באנגלית. אם אתם מחפשים לשפר ביצועים בעברית, תצטרכו לתרגם אותו או לשלב מקורות נוספים.

מאיפה הגיעו הנתונים שמרכיבים את המאגר?

הנתונים נאספו ממאגרים פתוחים שונים שנוצרו ברשת עד סוף שנת 2023. בין המקורות נכללים SlimOrca, Airoboros, שיחות מ־ShareGPT, משימות מדעיות של CamelAI ודוגמאות קוד של Glaive.

איך טוענים

הנתונים יושבים בקובץ פתוח בשם openhermes2_5.json, ואין צורך באישור גישה מיוחד כדי להוריד אותו. הטעינה מתבצעת ישירות מקובץ ה־JSON או דרך ספריית datasets. השדה הקריטי לעיבוד הוא conversations, שמכיל את רצף ההודעות עם השדות from ו־value, לצד שדות המקור source ו־category שכדאי לבדוק אם אתם רוצים לסנן תתי נושאים.

from datasets import load_dataset

ds = load_dataset("teknium/OpenHermes-2.5")

הרישיון

היוצר לא הגדיר רישיון רשמי למאגר. כשאין רישיון מוגדר, מבחינה משפטית אין היתר שימוש ברור, לא לצרכים מסחריים ולא למחקר. בנוסף, חלק גדול מהחומרים מבוססים על פלטים סינתטיים של GPT-4 ומקורות צד שלישי שונים, מה שיוצר סיכון משפטי ומקשה להכניס מודל שאומן עליו למוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗