GPT
G

gutenberg-dpo-v0.1

קוד פתוח

jondurbincc-by-4.02024-01-11

  • dpo

המאגר מכיל זוגות של העדפה שנועדו לשפר כתיבת פרוזה במודלי שפה, על בסיס ספרות קלאסית. במקום תשובות צ'אט רגילות, מקבלים כאן השוואה ישירה בין פרקים מקוריים לשכתובים סינתטיים של מודלים.

  • 1,202הורדות בחודש
  • 167לייקים

מה זה

הנתונים נשענים על ספרים מוכרים בנחלת הכלל מפרויקט גוטנברג, כמו מובי דיק, פרנקנשטיין וגאווה ודעה קדומה. היוצר בחר יצירות פופולריות שהספרייה chapterize הצליחה לפרק לפרקים בלי להישבר, ניקה תגיות איור וירידות שורה מיותרות, וחילק את הטקסט ליחידות עבודה.

משם התהליך הפך לסינתטי לחלוטין. מודל שפה קרא כל פרק ויצר פרומפט שנועד להפיק אותו מחדש, לצד תקציר של הפרק הקודם ששימש כהקשר להמשך. לאחר מכן הריצו מודלים כמו llama-2-13b-chat, bagel-7b-v0.1 ו־dolphin-2.2-34b כדי לכתוב את הפרק מתוך הפרומפט והתקציר. הטקסט המקורי של הסופר הוגדר כבחירה הטובה, והטקסט שהמודל פלט הוגדר כדחוי.

מתאים ל

  • אימון DPO לפרוזה

    כוונון ישיר של מודלים קיימים להעדפת סגנון סיפורי עשיר על פני ניסוחים רובוטיים.

  • בדיקת העדפות סגנון

    מדידה האם מודל מבדיל בין כתיבה ספרותית אנושית לבין פלט סינתטי טיפוסי.

  • תוספת לדאטהסט קיים

    ערבוב הנתונים לתוך מאגר העדפות רחב יותר כדי לחזק יכולות כתיבה יצירתית.

איפה זה נופל

זה מאגר קטן מאוד, עם פחות מאלף רשומות, כך שהוא לא יספיק לבדו לאימון מקיף. כל הטקסטים הם באנגלית מהמאות הקודמות, ואין פה עברית או סגנון כתיבה מודרני. מעבר לזה, המודל שלכם ילמד להעדיף אנגלית קלאסית ומורכבת על פני שפה פשוטה, ולא בטוח שזה מה שאתם מחפשים במוצר שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט מתאים למחבר.

האם יש במאגר טקסטים בעברית?

לא, המאגר כולו באנגלית. הוא מבוסס על תרגומים ויצירות מקוריות באנגלית שנמצאות בנחלת הכלל.

כמה רשומות יש בפנים ומה המשקל של הקובץ?

המאגר קטן מאוד ומכיל פחות מאלף דוגמאות בפורמט parquet. ההורדה לוקחת שניות בודדות ולא דורשת משאבי אחסון מיוחדים.

איך נאספו הנתונים לפסילה?

הפרקים הדחויים נכתבו על ידי מודלי קוד פתוח כמו llama-2-13b-chat ו־dolphin על בסיס תקצירים. הטקסט הנבחר הוא תמיד המקור שנלקח מפרויקט גוטנברג.

איך טוענים

טוענים את המאגר ישירות מ־Hugging Face בלי צורך בבקשת גישה או אישור מוקדם. הנתונים מגיעים בקובץ gutenberg-dpo.parquet יחיד, כך שההורדה מהירה מאוד וכמעט לא תופסת מקום בדיסק. המאגר מכיל פחות מאלף רשומות, וכולל את הפרומפטים שנוצרו, לצד עמודות הבחירה של הטקסט המקורי מול הפלט הסינתטי שנפסל.

from datasets import load_dataset

ds = load_dataset("jondurbin/gutenberg-dpo-v0.1")

הרישיון

הרישיון הוא cc-by-4.0, שמאפשר שימוש מסחרי, שינוי והפצה, כל עוד אתם נותנים קרדיט מתאים ליוצר. אין כאן דרישה לשיתוף תחת אותו רישיון, כך שאתם יכולים לאמן עליו מודלים מסחריים בלי לחשוף את המשקולות שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗