GPT
O

orca-chat

קוד פתוח

shahules786apache-2.02023-07-17

גרסה מעובדת של אורקה שמסדרת הוראות מבוססות הסבר במבנה של שיחות רב-שלביות. היא פותרת בעיות של כפילויות ומגבלות הקשר קצרות שהיו במקור.

  • 220הורדות בחודש
  • 112לייקים

מה זה

המאגר מבוסס על השחזור של דאטהסט אורקה שביצע אריק הרטפורד בפרויקט דולפין, בשיתוף פעולה עם אנשי צוות אופן אסיסטנט. אורקה המקורי כלל הוראות בסגנון הסבר, אבל סבל מדוגמאות פשוטות מדי מעל 4k טוקנים ומעודף גדול של הוראות דומות שסתם ניפחו את זמן החישוב באימון.

כדי לפתור את זה, המפתח ניקה וסינן דוגמאות בעלות דמיון גבוה מאוד. לאחר מכן הוא קיבץ הוראות בודדות יחד כדי לייצר רצף שנראה כמו שיחה אמיתית, במקום רשימה מבודדת של שאלות ותשובות.

התוצר מחזיק קובץ נתונים מרכזי בשם orca-chat-gpt4-8k.json שמותאם לחלון הקשר של עד 8k טוקנים. אין כאן חלוקה מובנית לחלקי אימון ומבחן, אלא קובץ יחיד של שיחות שעברו עיבוד ואשכול מחדש.

מתאים ל

  • אימון מודלי שיחה

    התאמת מודל שפה למבנה שיחה מרובה שלבים שמסוגל לענות בהסברים מפורטים.

  • אימון לחלונות 8k

    פיין טיונינג למודלים שתומכים בהקשר של עד שמונת אלפים טוקנים בלי דוגמאות מקוטעות.

  • מחקר על אשכול נתונים

    בדיקת השפעת קיבוץ הוראות בודדות לרצפי שיחה על איכות הפלטים הסופית.

איפה זה נופל

הכרטיס לא מציין תמיכה בעברית, והנתונים נשענים על שחזור מבוסס מודלים באנגלית מיולי 2023. המפתח אמנם מעיד שהוא סינן כפילויות, אבל אין פירוט מדויק של מדדי הסינון או בדיקות בטיחות שנעשו על הפלטים. לפני שמשלבים את זה באימון מודל, צריך לבדוק ידנית את איכות השרשור של השיחות ולוודא שהחיבור בין ההוראות לא יצר מעברים לא הגיוניים.

שאלות
נפוצות

האם הדאטהסט כולל עברית?

הכרטיס אינו מציין תמיכה בעברית כלל. הנתונים מבוססים על פרויקט דולפין ושחזורי אורקה באנגלית בלבד.

האם מותר להשתמש בו למוצר מסחרי?

המאגר מוגדר תחת רישיון אפאצ'י 2.0 שמאפשר שימוש מסחרי. יחד עם זאת, הנתונים הם תוצרי מודלים כמו GPT-4, כך שצריך לקחת בחשבון את תנאי השימוש של יוצרי המודלים הללו.

במה הוא שונה מדאטהסט אורקה המקורי?

המקור הכיל הוראות בודדות עם המון כפילויות ודוגמאות טריוויאליות מעל 4k טוקנים. כאן סילקו דוגמאות דומות וחיברו הוראות יחד כדי ליצור מבנה של שיחה רציפה באורך של עד 8k.

איך הנתונים נאספו ועובדו?

הבסיס נלקח משחזור אורקה של אריק הרטפורד. המפתח, יחד עם אנשי אופן אסיסטנט, ביצע סינון דמיון כדי להסיר עודפים וקיבץ את ההוראות שנותרו לפורמט שיחה.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטים של הגינג פייס או מורידים את הקובץ orca-chat-gpt4-8k.json. המאגר פתוח לציבור, בלי צורך באישור גישה או מפתחות. הנתונים שמורים במבנה ג'ייסון סטנדרטי של שיחה, וכדאי לשים לב לאורך הרצפים כדי לוודא שהם יושבים טוב בחלון ההקשר שאתם מקצים לאימון.

from datasets import load_dataset

ds = load_dataset("shahules786/orca-chat")

הרישיון

הרישיון המדווח הוא אפאצ'י 2.0. הוא מתיר שימוש מסחרי, שינוי והפצה, בלי חובה לשחרר את המודל המאומן תחת אותו רישיון, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. עם זאת, מקור הנתונים כולל פלטים שנוצרו על ידי מודלים של חברות מסחריות, מה שעשוי להטיל מגבלות חיצוניות שלא תלויות ברישיון הקוד הפתוח עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗