GPT
N

NekoQA-10K

קוד פתוח

liumindmindapache-2.02025-08-20

ערכת נתונים של עשרת אלפים שיחות שנועדה להקנות למודלי שפה אישיות מוגדרת של נערת חתול. היא מתאימה למי שבודק שינוי סגנון דיבור, עקביות דמות ומענה שמכוון לקשר רגשי.

  • 288הורדות בחודש
  • 69לייקים

מה זה

המאגר כולל עשרת אלפים זוגות של שאלות ותשובות בסינית, עם מעט שילוב של אנגלית. כל התשובות עברו התאמה לסגנון דיבור ספציפי של דמות נערת חתול, שבו המודל פונה למשתמש בתור אדון, משתמש בסיומות קבועות כמו מיאו ואימוץ טון חמוד.

המקורות מגוונים. חלק מהשאלות והתשובות נכתבו ידנית, חלק נאספו מפורומים ציבוריים ברשת כמו רואוז'יבה ושופצו באמצעות מודל שפה, וכ־900 רשומות נלקחו ממאגרים קיימים של אותה דמות ועובדו מחדש. רוב התשובות נוצרו על ידי מודל שפה ועברו סינון אנושי כדי לוודא אחידות בסגנון ובטיחות תוכן.

מתאים ל

  • אימון סגנון דמות

    כוונון מודלי שיחה לדיבור בנימה של נערת חתול ושמירה על סיומות קבועות.

  • בדיקת עקביות פרסונה

    מחקר על היכולת של המודל לא לסטות מהדמות שהוגדרה לו לאורך דיאלוג.

  • הערכה בבנצ'מרק

    מדידת ביצועים מול מדד NekoBench שמוזכר בתיעוד לבדיקת סגנון התגובות.

איפה זה נופל

יוצרי המאגר מציינים מראש שהתשובות מנוסחות בנימה קלילה ולא מתחייבות לדיוק עובדתי. אימון על הנתונים האלה עלול לגרום למודל לענות בצורה חמודה מדי או ילדותית גם כשמציגים לו משימות רציניות. בנוסף, כל החומר מבוסס על השפה הסינית עם מעט אנגלית, כך שאין כאן שום מידע בעברית או התאמה להקשר מקומי, ואי אפשר להסתמך עליו למשימות שדורשות אמינות מקצועית.

אותה משפחה

NekoQA יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מאפשר שימוש מסחרי מלא. אתם צריכים רק לספק ייחוס מתאים לקובצי המקור. קחו בחשבון שחלק מהנתונים שוכתבו על ידי מודלי שפה מתכנים ברשת, כך שכדאי לבדוק את התאמת התוכן למוצר שלכם.

האם המאגר כולל תמיכה בעברית?

לא, אין במאגר עברית בכלל. הטקסט כולו כתוב בסינית עם מעט ביטויים באנגלית שמשולבים בתוכו. אם המטרה היא אימון בעברית, תצטרכו לתרגם את הנתונים ולהתאים את מאפייני הסגנון לשפה.

איך נאספו ונוצרו הנתונים?

המאגר נבנה משילוב של שאלות מקוריות שנכתבו ידנית, לצד פוסטים מפורומים ציבוריים ברשת הסינית. התשובות נוצרו ברובן על ידי מודל שפה כדי להבטיח את סגנון הדיבור המבוקש. לאחר מכן נעשה סינון ידני כדי להסיר תכנים בעייתיים.

האם המידע בשיחות מדויק מבחינה עובדתית?

לא, הכרטיס מבהיר במפורש שהדגש הוא על האופי והסגנון ולא על נכונות המידע. התשובות קלילות ונועדו למשחקי תפקידים או ליווי רגשי. לא מומלץ להשתמש בו לאימון עוזר שמיועד לפתרון בעיות אמיתיות או מתן עובדות.

איך טוענים

הקובץ המרכזי מגיע בפורמט JSON בשם NekoQA-10K.json, ללא צורך בהרשאת גישה מיוחדת או תהליך אישור מול היוצר. אין פה חלוקה מובנית מראש לאימון ומבחן בתוך המאגר, כך שתצטרכו לפצל את עשרת אלפים הדוגמאות בעצמכם. מבנה הרשומות מבוסס על שאלות ותשובות שמיועדות ישירות לכוונון עדין של מודלי שיחה.

from datasets import load_dataset

ds = load_dataset("liumindmind/NekoQA-10K")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, מאפשר לבצע שינויים ואינו מחייב אתכם לשחרר מודל שאומן עליו תחת אותו הרישיון. התנאי העיקרי הוא מתן קרדיט ושמירה על הודעות זכויות היוצרים המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗