GPT
O

OpenOrca-Chinese

קוד פתוח

yysmit2023-09-07

תרגום של מאגר ההוראות הפופולרי אורקה לסינית באמצעות גוגל טרנסלייט. הוא נותן מענה מהיר למי שרוצה לאמן מודלים על הנחיות מורכבות ומנומקות בלי לבנות דאטהסט מאפס.

  • 352הורדות בחודש
  • 104לייקים

מה זה

המאגר מבוסס במקור על OpenOrca, שמכיל משימות מגוונות מתוך אוסף FLAN שנענו על ידי המודלים של OpenAI. הרעיון במקור היה לחקות את תהליכי החשיבה של מודלים חזקים, כולל הסברים מפורטים ופתרון בעיות צעד אחר צעד, כדי לאמן עליהם מודלים קטנים יותר.

בגרסה הזו לקחו את הטקסטים המקוריים ותרגמו אותם ישירות לסינית באמצעות מנוע התרגום של גוגל. המבנה נשמר כפי שהיה, ומחולק לשני קבצים עיקריים לפי מקור התשובה: קובץ של כמיליון רשומות שנוצרו על ידי GPT-4, וקובץ של כשלושה וחצי מיליון רשומות מבוססות GPT-3.5.

כל רשומה מורכבת מארבעה שדות מרכזיים. שדה המזהה כולל את מקור המשימה המקורי מאוסף FLAN, כמו שאלות חשיבה או משימות סיווג. לצידו מופיעים שדה הוראת המערכת שניתנה למודל, שאלת המשתמש, והתשובה המלאה שנוצרה, כאשר הטקסטים מוצגים בסינית.

מתאים ל

  • אימון מודלי שיחה בסינית

    כוונון עדין של מודלי שפה לתקשורת והבנת פקודות בסינית על בסיס הנחיות מגוונות.

  • הערכת ביצועי מודלים

    מבחן יכולת למודלים קיימים על משימות סיווג, סיכום ומענה לשאלות שמקורן באוסף FLAN.

  • מחקר על תרגום מכונה

    בדיקת ההשפעה של דאטה שעבר תרגום אוטומטי לעומת טקסט שנכתב במקור בסינית.

איפה זה נופל

הבעיה הגדולה ביותר כאן היא אופן ההפקה. תרגום מכונה אוטומטי של גוגל טרנסלייט מייצר שגיאות תחביר, ניסוחים לא טבעיים בסינית ואיבודי משמעות עדינים במשימות לוגיות מורכבות. המאגר מוגבל לשפה הסינית בלבד ואין בו תכנים בעברית. בנוסף, הנתונים הועלו בספטמבר 2023 ומבוססים על דורות ישנים יחסית של מודלים, ללא בדיקת איכות אנושית שתסנן תשובות שגויות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא MIT שמתיר שימוש מסחרי ללא מגבלות מיוחדות. עם זאת, התשובות נוצרו בעזרת מודלים של OpenAI ותרגום גוגל, מה שעשוי לעורר שאלות לגבי תנאי השימוש של אותם שירותים חיצוניים.

האם יש במאגר הזה תמיכה בעברית?

לא, המאגר מיועד כולו לשפה הסינית בלבד. כל ההוראות והתשובות תורגמו מאנגלית לסינית, כך שהוא אינו מתאים למי שמחפש נתוני אימון בעברית.

כיצד נאספו הנתונים במאגר?

היוצר לקח את הדאטהסט OpenOrca המקורי והריץ אותו במלואו דרך מנוע התרגום של גוגל. הנתונים המקוריים הם שאלות ממאגר FLAN שהוגשו ל־GPT-4 ו־GPT-3.5 כדי לחלץ מהם תשובות מפורטות.

במה הוא שונה מהמאגר המקורי OpenOrca?

ההבדל היחיד הוא השפה של הטקסטים. בעוד המאגר המקורי נכתב כולו באנגלית, הגרסה הזו מכילה את אותן שאלות ותשובות בדיוק לאחר שעברו תרגום מכונה אוטומטי לסינית.

איך טוענים

הנתונים שמורים בשני קבצי parquet נפרדים שזמינים להורדה ישירה ללא צורך באישור מיוחד. כדי לעבוד איתם אפשר לטעון ישירות את המזהה yys/OpenOrca-Chinese באמצעות ספריית datasets של Hugging Face. הטבלה כוללת את העמודות id, system_prompt, question ו־response. מדובר במיליוני שורות, לכן הטעינה והעיבוד דורשים זיכרון עבודה מספק ומשאבי אחסון מתאימים לעבודה עם קבצי ענק.

from datasets import load_dataset

ds = load_dataset("yys/OpenOrca-Chinese")

הרישיון

המאגר פורסם תחת רישיון MIT. המשמעות היא חופש מלא להשתמש במידע, לשנות אותו, לשלב אותו בפרויקטים פנימיים או לאמן עליו מודלים לשימוש מסחרי, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אין חובה לשתף את המודל המאומן או את הנגזרות תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗