GPT
C

COIG

קוד פתוח

BAAIapache-2.02023-04-16

מאגר הוראות מגוון בסינית שכולל תרגומים מאומתים, שאלות מבחנים, יישור ערכים ותרגילי תכנות. הוא מתאים למי שמאמן מודל שפה ורוצה בסיס מקיף שנבנה במיוחד עבור השפה הסינית.

  • 2,130הורדות בחודש
  • 462לייקים

מה זה

המאגר מחולק לחמישה חלקים נפרדים. החלק הראשון מכיל הוראות כלליות שתורגמו מאנגלית באופן אוטומטי ועברו אימות ותיקון ידני. החלק השני כולל שאלות ממבחני כניסה ממשלתיים ואקדמיים בסין, המחולקות למקצועות כמו סינית, אנגלית, פוליטיקה וביולוגיה, לצד ניתוח מפורט שיכול לשמש לשרשראות מחשבה.

שאר החלקים מתמקדים בצרכים ספציפיים. יש בו מאגר ליישור ערכים תרבותיים המותאמים לעולם דובר הסינית, שיחות מרובות סבבים בין מורה לתלמיד שנבנו על בסיס גרף ידע כדי לתקן הזיות עובדתיות, ואוסף של אלפי תרגילי תכנות שמקורם בפלטפורמת ליטקוד עם הסברים ופתרונות בשפות שונות.

מתאים ל

  • כוונון מודלים להוראות

    אימון מודלי שפה בסינית להבנה וביצוע של משימות כלליות על בסיס הוראות מנוסחות.

  • פתרון מבחנים והסבר צעדים

    לימוד מודלים לפתור שאלות רב ברירה במדעי הרוח והחברה לצד הפקת ניתוח מפורט של התשובה.

  • הפחתת הזיות בשיחה

    אימון על דיאלוגים מרובי סבבים המבוססים על גרף ידע לתיקון טענות שגויות בזמן אמת.

  • יצירת קוד לפי תיאור

    הוראות לתכנות ותרגול פתרון אלגוריתמים בשפות פיתוח שונות בליווי הסברים בסינית.

איפה זה נופל

המאגר מתמקד כולו בסינית ואין בו תוכן בעברית. בחלק המבחנים כמעט ואין שאלות במתמטיקה, פיזיקה וכימיה בגלל מורכבות הסימונים, ובשאלות התכנות יש 834 שאלות ללא הסבר. בנוסף, הכרטיס מזהיר מקיומו של מידע סינתטי ומקרים שבהם משתמשים ניסו לגרום למודלים לפלוט תוכן פוגעני או רעיל, כך שחובה לסנן את החומר לפני שמשלבים אותו במוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

המאגר עצמו פורסם תחת Apache 2.0, רישיון שמאפשר שימוש מסחרי. יחד עם זאת, חלקים מתוכו נלקחו ממקורות אחרים, כמו מאגר התכנות שמקורו ברישיון ייחוס שיתוף זהה ותוכן שנאסף מהרשת. אם בונים מודל מסחרי, כדאי לבדוק את מקורות המשנה של הקבצים הספציפיים שבהם משתמשים.

האם המאגר רלוונטי למי שמפתח בעברית?

לא. המאגר מיועד באופן בלעדי לעבודה בסינית ומכיל נתונים בשפה זו בלבד. אין בו דוגמאות בעברית ואי אפשר להשתמש בו לשיפור ישיר של מודלים בשפה המקומית.

איך נאסף המידע למאגר?

הנתונים הגיעו ממספר מקורות שונים. חלק אחד מבוסס על תרגום מאגרי הוראות קיימים באנגלית שעברו סינון ותיקון ידני, חלק שני כולל שאלות ממבחני כניסה ממלכתיים בסין, וקטעים אחרים מבוססים על תרגילי ליטקוד וגרף הידע CN-DBpedia.

איך טוענים את הנתונים לעבודה?

היוצרים מציינים שעדיף להוריד את הקבצים ישירות מהמאגר ולא דרך פקודת הטעינה הרגילה של Hugging Face. הקבצים מחולקים לפי נושאים בפורמטים של JSON وJSONL, וקובץ השיחות דחוס בארכיון נפרד.

איך טוענים

היוצרים ממליצים להוריד ישירות את הקבצים הבודדים שצריכים מדף המאגר ולא להסתמך על טעינה אוטומטית של הספרייה. הקבצים שמורים בפורמטים של JSONL ושל JSON, וחלק השיחות ארוז בקובץ ארכיון דחוס. אין צורך באישור גישה מיוחד כדי להוריד את המידע. ברשומות המבחנים למשל תמצאו שדות עבור ההוראה, ההקשר, השאלה, התשובה וניתוח התשובה.

from datasets import load_dataset

ds = load_dataset("BAAI/COIG")

הרישיון

המאגר מופץ ברישיון Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן עליו מודלים מסחריים בלי לחייב פתיחה של הקוד. יש לציין שהחומרים בפנים משלבים מקורות נוספים, כולל תוכן ברישיון MIT, תרגילים ברישיון CC-BY-SA-4.0 ונתונים שנאספו מהרשת תחת שימוש הוגן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗