GPT
K

kullm-v2

קוד פתוח

nlpai-labapache-2.02023-06-01

תרגום קוריאני מרוכז של שלושה מאגרי הוראות מוכרים שנבנה ישירות עם תרגום מכונה. הוא מיועד למי שמפתח מודל שיחה שצריך להבין ולענות בקוריאנית.

  • 540הורדות בחודש
  • 77לייקים

מה זה

המאגר כולל רשומות הוראה ותשובה שנלקחו משלושה מקורות מוכרים: GPT4ALL, Dolly, ו־Vicuna. כל רשומה כוללת מזהה ייחודי, שדה הוראה, שדה קלט שלעתים נשאר ריק, ושדה פלט שמכיל את התשובה המלאה. המבנה תואם לחלוטין לפורמט המקובל של אימון הוראות ומאפשר לטעון את הנתונים ישירות לשלבי כוונון עדין.

כל התוכן עבר תרגום לקוריאנית באמצעות ה־API של DeepL. המפתחים תרגמו את שלושת השדות המרכזיים: ההוראה, הקלט והפלט. אין בכרטיס תיעוד על סינון ידני של שגיאות, בקרת איכות אנושית על הפלטים, או חלוקה מובנית לסט אימון ובדיקה נפרדים, כך שכל 152,630 הדוגמאות מגיעות יחד תחת פיצול יחיד.

מתאים ל

  • אימון מודלי שיחה

    כוונון עדין למודלים שצריכים לקבל פקודות ולהחזיר תשובות בקוריאנית שוטפת.

  • הערכת ביצועי שפה

    בדיקת יכולת המענה של מודל קיים מול שאלות מגוונות שתורגמו לקוריאנית.

  • השוואת תרגומי מכונה

    שימוש בטקסט כבסיס לחקר איכות פלטים שמקורם במערכת התרגום של DeepL.

איפה זה נופל

הדאטהסט מוגבל כולו לקוריאנית בלבד ואין בו מילה אחת בעברית. הבעיה העיקרית היא ההסתמכות המוחלטת על תרגום מכונה אוטומטי של DeepL, שעלול לייצר ניסוחים מלאכותיים, תרגומי שמות עקומים וטעויות הבנה בתחומים מקצועיים. מעבר לזה, המקורות המקוריים נוצרו לפני יוני 2023 ומבוססים בחלקם על פלטים של מודלים סגורים, כך שצריך לבדוק היטב דיוק עובדתי והזיות לפני שמשלבים את המידע במערכת אמיתית.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. כל הנתונים במאגר תורגמו לקוריאנית בלבד. אם המטרה היא אימון בעברית, המאגר הזה לא רלוונטי עבורכם.

מאיפה הגיעו הנתונים המקוריים?

הנתונים נלקחו משלושה מאגרי הוראות מוכרים: Dolly, Vicuna, ו־GPT4ALL. לאחר מכן, צוות הפיתוח תרגם אותם לקוריאנית דרך DeepL API.

האם מותר להשתמש במאגר למוצר מסחרי?

הכרטיס מציג רישיון Apache-2.0 שמאפשר שימוש מסחרי מלא. יחד עם זאת, כדאי לזכור שהנתונים מבוססים על מאגרים שחלקם נוצרו באמצעות מודלים מסחריים אחרים.

האם צריך אישור גישה מיוחד כדי להוריד אותו?

לא נדרש שום אישור. המאגר ציבורי ופתוח לכולם, ואפשר למשוך אותו מיד בקוד בעזרת פקודת load_dataset רגילה.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets באמצעות ציון הנתיב nlpai-lab/kullm-v2 והפיצול train. אין צורך לבקש אישור גישה מוקדם או להגדיר מפתח אישי, הכל פתוח להורדה. הקובץ המרכזי שמכיל את הנתונים מגיע בפורמט jsonl וכולל ארבעה שדות: id, instruction, input, ו־output. לפני תחילת האימון כדאי לשים לב ששדה הקלט ריק בחלק מהדוגמאות, ולכן צריך לשרשר אותו להוראה רק כשהוא קיים.

from datasets import load_dataset

ds = load_dataset("nlpai-lab/kullm-v2")

הרישיון

הרישיון המדווח בכרטיס הוא Apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. הוא לא מחייב לשתף את המודל המאומן באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗