GPT
L

llm-japanese-dataset

קוד פתוח

izumi-labcc-by-sa-4.02023-04-30

מאגר ענק של הוראות ושיחות ביפנית, שנבנה כדי ללמד מודלים שרואים בעיקר אנגלית להבין ולהגיב ביפנית טבעית. הוא מתאים למי שרוצה לאמן LoRA בלי להתחיל לאסוף מקורות מאפס.

  • 548הורדות בחודש
  • 143לייקים

מה זה

המאגר כולל מיליוני דוגמאות אימון למשימות שיחה ומענה להוראות, שחוברו יחד ממקורות שפה פומביים שונים ביפנית. בין המקורות שצוינו בכרטיס נמצאים תקצירי ויקיפדיה ביפנית, מאגר תיקוני שגיאות כתיב של ויקיפדיה, מאגר השאלות והתשובות jqac, ומאגר הטקסטים של Asian Language Treebank. היוצרים בנו את המאגר במיוחד כדי לאפשר כוונון עדין למודלים גדולים שבמקור אומנו בעיקר באנגלית.

לאורך הגרסאות נעשה סינון מתמשך של הנתונים כדי לנקות דוגמאות בעייתיות ולשמור על עקביות. בגרסה 1.0.1 הוסר לחלוטין החלק שהתבסס על מאגר Alpaca, לאחר ששינה את רישיונו לשימוש לא מסחרי. בהמשך נוקו רשומות פגומות שהכילו פלט ריק לגמרי מתוך תת המאגרים של תקצירי ויקיפדיה ושל מאגר alt, ועודכנה גרסת הטקסטים שנלקחו מוויקיפדיה נכון לתחילת 2024.

מתאים ל

  • כוונון LoRA לשיחה ביפנית

    אימון שכבות התאמה למודל שפה קיים באנגלית כדי להקנות לו יכולת מענה להוראות ביפנית שוטפת.

  • אימון מודל לשאלות ותשובות

    שימוש ברשומות שמקורן ביוזמות כמו jqac לצורך שיפור הדיוק של מענה לשאלות עובדתיות ביפנית.

  • מחקר על דחיסת ידע

    הערכת ביצועי מודלים על תקצירי ויקיפדיה ותיקוני שגיאות כתיב במסגרת מחקרים אקדמיים על השפה היפנית.

איפה זה נופל

המאגר מכיל יפנית בלבד ואין בו שום תוכן בעברית או בשפות אחרות. מעבר לכך, הנתונים מבוססים על גזירה של מקורות קיימים ולא על כתיבה אנושית שנבדקה שורה אחר שורה, כך שעדכוני הגרסאות נדרשו לתקן תקלות של פלטים ריקים שנשמטו מהסינון הראשוני. הכרטיס אינו מפרט חלוקה מובנית לסט מבחן או אימות, ומי שבונה מוצר יצטרך לבצע דגימה ובדיקת איכות ידנית של התשובות כדי לוודא שאין טעויות עובדתיות או עיוותים שנשאבו מטקסטים פתוחים ברשת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון כאן הוא cc-by-sa-4.0, שמתיר שימוש מסחרי אך כולל סעיף שיתוף זהה. המשמעות היא שכל עבודה נגזרת, כולל משקלי מודל שאומנו עליו, חייבת להיות מופצת תחת אותו רישיון פתוח. מי שמחפש רישיון מתירני יותר יכול לבדוק את גרסת ה־MIT שהיוצרים שחררו בגיטהאב.

האם יש במאגר דוגמאות בעברית?

לא. המאגר מיועד כולו לשפה היפנית ונבנה ממקורות יפניים כמו ויקיפדיה המקומית ומאגרי מידע אזוריים, ללא כל כיסוי של שפות שמיות או תוכן בעברית.

כמה רשומות יש במאגר והאם הוא יציב לשימוש?

בגרסה העדכנית 1.0.3 יש בדיוק 9,074,340 רשומות. המאגר עבר מספר סבבי ניקוי, כולל הסרת נתוני Alpaca וסילוק רשומות עם פלטים ריקים, כך שמומלץ למשוך גרסה מוגדרת זו ולא גרסאות ישנות שסבלו מתקלות.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה datasets של Hugging Face עם הפקודה load_dataset, תוך ציון שם המאגר והגרסה הרצויה בפרמטר revision. אין צורך באישור גישה מוקדם או בהרשמה מיוחדת, והקבצים זמינים להורדה מידית בפורמט jsonl מתוך הקובץ data-cc-by-sa.jsonl. בגרסה 1.0.3 המאגר מכיל 9,074,340 רשומות, כך שמדובר בנפח נתונים משמעותי שדורש משאבי זיכרון ואחסון מתאימים בעבודה מקומית. גרסה 0.1.0 סובלת מבאגים לפי התיעוד ולכן לא מומלץ להשתמש בה כלל, וכדאי לקבע את הגרסה המדויקת בקוד במקום להסתמך על main.

from datasets import load_dataset

ds = load_dataset("izumi-lab/llm-japanese-dataset")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-4.0, שמאפשר שימוש מסחרי, שינוי והפצה, אך מחייב מתן קרדיט ליוצרים ושיתוף של כל עבודה נגזרת תחת אותו הרישיון בדיוק. דרישת השיתוף הזו חלה גם על מודלים שיאומנו ישירות על המאגר, ולכן מי שמפתח מוצר קנייני סגור עלול להסתבך. היוצרים מציינים שקיימת גרסה תחת רישיון MIT בעמוד השחרורים שלהם בגיטהאב, ויש לבדוק אותה אם מעוניינים ברישוי גמיש יותר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗