GPT
O

openhermes

קוד פתוח

tekniumרישיון לא דווח2023-09-04

  • distillation
  • synthetic data
  • gpt

אוסף של 242,000 דוגמאות אימון שנוצרו ברובן על ידי GPT-4, מיועד למי שרוצה לאמן מודלי שיחה והוראות בלי הניסוחים המתחמקים של OpenAI.

  • 1,563הורדות בחודש
  • 228לייקים

מה זה

המאגר הזה מרכז נתונים שנוצרו על ידי GPT-4 ונאספו משורה של פרויקטים פתוחים אחרים ברשת. תמצאו כאן בין היתר את GPTeacher על שלל חלקיו שכוללים שיחה, משחקי תפקידים וקוד, את הדאטהסטים של WizardLM עם שבעים אלף הוראות, Airoboros בגרסה הראשונה, מאגרי מומחים של Camel-AI, קוד מתוך CodeAlpaca, וכן דוגמאות מתוך GPT4-LLM ו־Unnatural Instructions של מיקרוסופט.

התערובת הזו זהה כמעט לחלוטין לבסיס של Nous-Hermes המקורי, מלבד שני מאגרים פרטיים שהושמטו כדי להשאיר את המידע פתוח. תהליך הסינון התמקד בניקוי תבניות מוכרות של המודל המקורי, כך שהוסרו סירובים מפורשים של OpenAI, הערות אזהרה והתנצלויות בנוסח בתור מודל שפה.

מתאים ל

  • אימון מודל הוראות

    כוונון עדין של מודלי שפה למשימות מענה על שאלות וביצוע פקודות באנגלית.

  • הסרת התנצלויות סינתטיות

    אימון מודלים ללא תבניות הדיבור המתחמקות והסירובים הרגילים של OpenAI.

  • אימון על משימות קוד

    שיפור יכולות תכנות של מודלים קטנים באמצעות הדוגמאות מ־CodeAlpaca ו־GPTeacher.

איפה זה נופל

הנתונים כולם באנגלית ואין כאן עברית כלל. מעבר לשפה, הדאטהסט כולו מבוסס על תוכן סינתטי שנוצר ברובו על ידי GPT-4 בתקופה שקדמה לספטמבר 2023, כך שכל הטיה, שגיאה עובדתית או הזיה שהיו קיימות במקור נכנסו גם לכאן. למרות שנוקו התנצלויות וסירובים גלויים, טיב התשובות והנכונות המקצועית שלהן בתחומים מורכבים כמו קוד או ידע מקצועי דורשים בדיקה מדגמית קפדנית לפני שמכניסים מודל כזה לשימוש מעשי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצרים מסחריים?

לא מומלץ בכלל. בעמוד המאגר לא דווח שום רישיון, מה שאומר שאין לכם הרשאה משפטית ברורה לעשות בו שימוש. בנוסף, הנתונים הופקו מ־GPT-4, מה שמתנגש עם תנאי השימוש של OpenAI לגבי אימון מודלים מסחריים.

האם יש במאגר נתונים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל המקורות שמהם הוא נאסף כוללים טקסטים באנגלית. אם אתם מחפשים לאמן מודל שיבין עברית, הדאטהסט הזה לא יעזור לכם.

מה ההבדל בינו לבין המאגר של Nous-Hermes?

התערובת כמעט זהה לחלוטין. ההבדל היחיד הוא שהמאגר הזה השמיט שני מאגרי נתונים פנימיים שהיו פרטיים במקור, Nous-Instruct ו־PDACTL, כדי שכל המידע יהיה מורכב רק מדאטהסטים ציבוריים.

איך טוענים

הגישה למאגר פתוחה לחלוטין ואין צורך לבקש אישור או להמתין לאימות. המידע שמור בקובץ json יחיד בשם openhermes.json לצד תיעוד ה־README, כך שתוכלו לטעון אותו ישירות דרך ספריית datasets באמצעות המזהה teknium/openhermes או להוריד את הקובץ ישירות מהמאגר ולנתח אותו בכלים מקומיים.

מכיוון שהקובץ כולל מעל מאתיים וארבעים אלף רשומות טקסט של שיחות והוראות, כדאי לוודא שיש לכם מספיק זי RAM פנוי לפני הטעינה למערכת, ולבדוק את מבנה ההודעות והשדות בקובץ לפני שמתחילים אימון.

from datasets import load_dataset

ds = load_dataset("teknium/openhermes")

הרישיון

בעמוד המאגר לא צוין רישיון כלל. בפועל, כשהיוצר לא הגדיר רישיון ברור, אין לכם אישור רשמי להשתמש במידע, לא לפיתוח פנימי ובטח לא למוצר מסחרי. בנוסף, הנתונים נוצרו באמצעות GPT-4, מה שמעלה שאלות לגבי תנאי השימוש של OpenAI בנוגע לאימון מודלים מתחרים.

הרישיון המלא ב־Hugging Face ↗