GPT
K

korean_textbooks

קוד פתוח

maywellapache-2.02023-12-27

מאגר ענק של טקסטים סינתטיים בקוריאנית שנוצרו עם Gemini Pro. הוא מתאים למי שרוצה לאמן מודל בקוריאנית על חומרי לימוד מגוונים לפי שיטת Textbooks Are All You Need.

  • 2,684הורדות בחודש
  • 124לייקים

מה זה

המאגר מכיל מיליוני רשומות סינתטיות שנבנו על בסיס רשימה ארוכה של מקורות קיימים, במטרה לחקות ספרי לימוד איכותיים. במקום לאסוף טקסטים גולמיים מהרשת, היוצר לקח דאטהסטים מוכרים כמו Tiny-Textbooks, חלקי MMLU מרובים, Claude Evol, HelpSteer ו־Code-Alpaca, וייצר מהם תוכן קוריאני באמצעות מודל השפה.

התוכן מחולק לתתי-מאגרים לפי נושאים ומקורות. יש בו חלוקה מפורטת לעשרות מקצועות מתוך MMLU כמו אלגברה, אנטומיה, כימיה והיסטוריה, לצד שאלות מדעיות ומאגרי הוראות. היוצר מדגיש ששם תת-המאגר אינו מעיד בהכרח על התוכן המדויק של הרשומות, ושחלקים מסוימים כמו זה שמבוסס על Code-Alpaca אינם מכילים בעיקר קוד.

מתאים ל

  • אימון מקדים למודל קוריאני

    הרחבת אוצר המילים והידע של מודלים בקוריאנית על גבי מיליוני פסקאות בנושאים אקדמיים.

  • יצירת מאגר שאלות ותשובות

    עיבוד הטקסטים בעזרת מודל שפה מקומי כדי לחלץ זוגות של שאלות ותשובות מתוך חומרי הלימוד.

  • אימון מודל הוראות בקוריאנית

    שימוש בתת-המאגרים המבוססים על הוראות כדי לכוונן מודלים לענות לקוראים בשפה הקוריאנית.

איפה זה נופל

היוצר מציין במפורש שהנתונים דורשים עיבוד וסינון נוספים לפני אימון, וממליץ לעבד אותם עם מודל מקומי לפורמטים כמו שאלות ותשובות. כל המידע נוצר באמצעות מודל סינתטי, כך שקיימות הזיות וטעויות עובדתיות מובנות. בנוסף, המאגר כולו בקוריאנית ואין בו תוכן בעברית או התאמה להקשר מקומי, והוא נשען על נתונים שנכונים לסוף שנת 2023.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון המוגדר הוא Apache 2.0 שמאפשר שימוש מסחרי מלא. עליכם רק לצרף את תנאי הרישיון ומתן קרדיט ליוצר. עם זאת, קחו בחשבון שהטקסט נוצר על ידי Gemini Pro וכדאי לוודא שאין סתירה עם תנאי השימוש שבהם הוא הופק.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מיועד כולו לשפה הקוריאנית ומכיל רשומות מתורגמות ומסונתזות בקוריאנית בלבד. אין בו שום תמיכה או ייצוג לעברית. אם אתם מחפשים חומרים לפרויקט מקומי, תצטרכו לתרגם אותו בעצמכם או לחפש מקור אחר.

האם אפשר להשתמש בנתונים לאימון מודל באופן מיידי?

היוצר מדגיש שלא מומלץ לאמן על הדאטהסט כפי שהוא. הנתונים לא עברו ניקוי מוחלט ודורשים התאמה למשימה הספציפית שלכם, כמו המרה למבנה שיחה או סינון הזיות. עבודה ישירה איתו עלולה לפגוע באיכות המודל הסופי.

איך הדאטהסט הזה נאסף ונבנה?

הוא לא נסרק ישירות מאתרי אינטרנט אלא יוצר באופן סינתטי לחלוטין באמצעות המודל Gemini Pro. היוצר השתמש במאגרי מידע קיימים כמו MMLU ו־HelpSteer כבסיס ליצירת ספרי לימוד מלאכותיים. התהליך בוצע לפי המתודולוגיה של המאמר Textbooks Are All You Need.

איך טוענים

טוענים את המאגר ישירות מ־Hugging Face בלי צורך בהרשאה מיוחדת או מפתח גישה. הנתונים מאוחסנים ב־50 קובצי Parquet שמחולקים לפי תת-המאגרים, כך שמומלץ למשוך רק את החלקים הספציפיים שמעניינים אתכם ולא להוריד את כל המאגר בבת אחת אם אתם מוגבלים בנפח אחסון.

from datasets import load_dataset

ds = load_dataset("maywell/korean_textbooks")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר מודלים שאימנתם תחת אותו הרישיון. תצטרכו רק לכלול עותק של הרישיון והודעת ייחוס למחבר המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗