GPT
K

KoCommercial-Dataset

קוד פתוח

MarkrAImit2024-03-06

מאגר הוראות ושאלות ותשובות בקוריאנית המיועד לאימון מודלים לשימוש מסחרי. הוא מרכז כ־1.44 מיליון רשומות ממקורות שונים עם דגש על משימות הבנה והסקה.

  • 262הורדות בחודש
  • 166לייקים

מה זה

המאגר מכיל כ־1.44 מיליון דוגמאות בפורמט של הוראות ותשובות בקוריאנית. המידע נשען על איסוף מכמה מקורות קיימים, ביניהם גרסאות מסחריות של KOpen-platypus, KoAlpaca-v1.1a, WIKI_QA_Near_dedup ו־KorQuadv1.0, לצד נתונים שעובדו מתוך מאגרי AIHUB ציבוריים כמו סיכומי ספרים, מאמרים ומסמכים.

העיבוד של נתוני AIHUB נעשה בשיטות למידה בהנחיה עצמית, וכולל משימות מגוונות: סיכום טקסטים, שחזור סדר משפטים שבלבלו בהם את הסדר, ניבוי המשפט הבא, שאלות מרובות על קטע נתון והשלמת מילים חסרות. היוצרים מציינים כי עקב סוגיות זכויות יוצרים מול AI-Hub ו־NIA, הקוד לייצור הנתונים פורסם בנפרד, והדאטה שנוצר דרכו לא עבר את שלב הסינון והתיקון של המודל המקומי שלהם.

מתאים ל

  • כוונון הוראות בקוריאנית

    אימון מודלי שפה לעבודה עם משימות מורכבות, שאלות ותשובות וניסוח הנחיות בקוריאנית.

  • משימות סיכום והסקה

    שיפור יכולות מודל בתמצות מסמכים, שחזור מידע והבנת הנקרא מתוך טקסטים אקדמיים וספרותיים.

  • מחקר למידה מונחית עצמית

    בדיקת איכות נתונים שנוצרו אוטומטית באמצעות שחזור סדר משפטים והשלמת מסכות.

איפה זה נופל

החיסרון המרכזי מגיע ישירות מהצהרת היוצרים: הנתונים שנוצרו מקוד ה־SSL לא עברו סינון או תיקון באמצעות המודל הפנימי שלהם, כך שרמת הרעש והטעויות בטקסט עשויה להיות גבוהה. בנוסף, כל המאגר כתוב בקוריאנית בלבד ואין בו שום תמיכה בעברית או באנגלית. אם אתם מכוונים למוצר רגיש לדיוק, תצטרכו להריץ דה-דופליקציה וניקוי עצמאי לפני האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מסומן ברישיון MIT והיוצרים הצהירו שכללו רק מקורות המותרים לשימוש מסחרי. עם זאת, היוצרים הזכירו שהיו בירורים מול גופי AI-Hub ו־NIA לגבי זכויות יוצרים, כך שמומלץ לבדוק את מקורות המשנה.

האם המאגר כולל עברית?

לא, המאגר כולו מורכב מטקסטים בקוריאנית בלבד. אין בו דוגמאות בעברית או תרגומים לשפות אחרות.

מה המשקל של הדאטהסט וכמה דוגמאות יש בו?

הוא כולל כ־1.44 מיליון דוגמאות אימון. כל המידע שמור בקובץ parquet יחיד שנמצא במאגר, לצד קובצי תיעוד בלבד.

האם הנתונים עברו בדיקה וסינון ידני?

לא. היוצרים מציינים במפורש שהנתונים שנוצרו מקוד ה־SSL פורסמו כפי שהם, ללא מעבר בצינור הסינון והתיקון של המודל המקומי שלהם.

איך טוענים

הנתונים מרוכזים בקובץ יחיד בפורמט parquet תחת תיקיית data, בתוך מאגר שכולל שלושה קבצים בלבד. אין צורך בבקשת גישה מיוחדת או בחתימה על טופס, הקובץ זמין להורדה ישירה דרך huggingface. רשומות המאגר כוללות בעיקר שדות של הוראה ותשובה, ומוכנות להזנה לתהליכי כוונון מודלים.

from datasets import load_dataset

ds = load_dataset("MarkrAI/KoCommercial-Dataset")

הרישיון

המאגר מוגדר תחת רישיון MIT, מה שמתיר שימוש מסחרי חופשי, עריכה והפצה, כולל שילוב במודלים מסחריים סגורים. היוצרים מציינים שהנתונים נאספו רק ממקורות שמותרים מסחרית, אך מודים שהיו אי-הבנות סביב זכויות יוצרים מול AI-Hub ו־NIA.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗