GPT
C

COIG-CQIA

קוד פתוח

m-a-pרישיון לא דווח2023-12-04

מאגר מכוונן איכותי להוראות בסינית, שנבנה בהשראת LIMA ומבוסס על עשרות אלפי דוגמאות מפוקחות אנושית. הוא מתאים למי שרוצה לאמן מודל שיחה סיני אותנטי בלי להציף אותו במידע סינתטי רדוד.

  • 32,437הורדות בחודש
  • 768לייקים

מה זה

המאגר כולל עשרות אלפי רשומות הוראה בפורמט מובנה, שנאספו ממקורות רשת סיניים מגוונים. בין המקורות תמצאו פורומים ורשתות חברתיות כמו Zhihu, Douban ו־Xiaohongshu, לצד אנציקלופדיות כלליות, wikiHow, שאלות מבחנים ממשלתיים, ומאגרי מידע ממוקדים בפיננסים, רפואה, חוק ותרבות סינית מסורתית.

מרבית התשובות במאגר נכתבו במקור בידי בני אדם ולא נוצרו על ידי מודלי שפה, וחלק קטן בלבד הופק על ידי מודל ועבר בדיקה ידנית. תהליך הסינון כלל ניקוי מבוסס כללים, כתיבה של תבניות פרומפטים מגוונות, ואימות אנושי קפדני של איכות הנתונים כדי לוודא התאמה לאופי אינטראקציה טבעי.

מתאים ל

  • אימון הוראות למודלים בסינית

    כוונון עדין של מודלי שפה למתן מענה מדויק וטבעי לפניות משתמשים בסינית.

  • בניית עוזרי ידע מקצועיים

    התאמת מודלים לתחומי הרפואה, הפיננסים והמשפט בהתאם למקורות ידע סיניים.

  • הערכת יכולות שפה מסורתית

    בדיקת ביצועים של מודלים בהבנת פתגמים, שירה ותרגום שפה סינית קלאסית.

איפה זה נופל

הנתונים כולם בסינית בלבד, ללא שפות נוספות וללא עברית כלל. התוכן נשען על הרשת הסינית הפנימית וכולל תפיסות עולם, רגולציות ומבחנים שרלוונטיים לסין בלבד, כולל שימוש במאגרים מכווני ערכים מקומיים. מי שמפתח כלי לקהל מערבי או ישראלי יגלה שחלקים נרחבים כמו תחומי המשפט, הבריאות והתרבות לא יתאימו בלי התאמה עמוקה. בנוסף, מדובר בגרסה ראשונית שהוגדרה על ידי היוצרים כלא מושלמת במבנה השדות שלה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ לעשות זאת כרגע. המפתחים לא ציינו רישיון רשמי בדף הפרויקט, וחלק מהמידע נאסף מאתרים מסחריים כמו Zhihu ו־Douban. ללא היתר מפורש, אימון מודל מסחרי עלול לחשוף אתכם לתביעות על הפרת זכויות יוצרים.

האם יש במאגר נתונים בעברית או באנגלית?

אין במאגר עברית בכלל, והוא מיועד כולו לסינית. הטקסטים מתמקדים בסינית מפושטת ומסורתית, ומכסים נושאים תרבותיים ומקצועיים שרלוונטיים למרחב הסיני בלבד. למשימות שדורשות תמיכה רב-לשונית תצטרכו לשלב מקורות נוספים.

איך אספו וסיננו את המידע?

חוקרי הפרויקט אספו תוכן מאנציקלופדיות, מבחנים לאומיים וקהילות מקוונות ברשת הסינית. הנתונים עברו שילוב של סינון אוטומטי מבוסס כללים, כתיבה ידנית של תבניות פרומפטים ובדיקה אנושית ישירה. המטרה הייתה להעדיף איכות על פני כמות, בהשראת עקרונות מחקר LIMA.

במה הוא שונה ממאגרי הוראות סיניים אחרים?

רוב המאגרים ברשת מבוססים על תרגום מכונה מאנגלית או על יצירה אוטומטית ממודלי שפה גדולים. כאן רוב מוחלט של התשובות נכתב על ידי אנשים אמיתיים ברשת הסינית ונבדק ידנית. הגישה הזו מייצרת שפה טבעית ואמינה יותר בהשוואה לתוכן סינתטי.

איך טוענים

טוענים את המאגר ישירות מקבצי jsonl, כולל קובץ מלא בשם COIG-CQIA-full.jsonl או חלוקות משנה ייעודיות שנמצאות בתיקיות המאגר, למשל תכנים בסינית מסורתית. המאגר ציבורי לחלוטין ואין צורך בהרשאת גישה מיוחדת להורדה. כל רשומה כוללת שדות קלט ופלט ברורים, תיוג משימה ראשי ומשני, תחום ידע, מקור התשובה וציון האם התוכן עבר אימות אנושי.

from datasets import load_dataset

ds = load_dataset("m-a-p/COIG-CQIA")

הרישיון

היוצרים לא הגדירו רישיון שימוש בקבצי המאגר. המשמעות היא שאין הרשאה משפטית ברורה לשימוש מסחרי, ואימון מודל על הנתונים הללו עבור מוצר מסחרי חושף אתכם לסיכון של הפרת זכויות יוצרים, במיוחד כשחלק ניכר מהתוכן נאסף מאתרים ופורומים ברשת.

הרישיון המלא ב־Hugging Face ↗