GPT
C

coedit

קוד פתוח

grammarlyapache-2.02023-08-15

יש כאן גם סקירה על Grammarly עצמו.

מאגר שמכיל זוגות של הוראות עריכה וטקסט מתוקן עבור משימות שכתוב מוגדרות. הוא מיועד למי שרוצה לאמן מודלים לתקן דקדוק, לפשט משפטים או לשנות משלב בלי להסתבך עם פרומפטים כלליים מדי.

  • 2,201הורדות בחודש
  • 101לייקים

מה זה

כל רשומה במאגר כוללת מזהה ייחודי, סוג משימה, קלט ופלט. הקלט מורכב מהוראה מפורשת יחד עם טקסט המקור, כמו בקשה לתיקון דקדוקי, והפלט מציג את התוצאה הערוכה בלבד. המבנה הזה מכוון ישירות לאימון מודלים לפי הוראות, כשהטקסט מנותב למשימות עריכה ספציפיות כמו תיקוני שגיאות או ניסוח מחדש.

הנתונים נאספו ונערכו מתוך מאגרים ציבוריים קיימים. בגרסה המקורית של המחקר השתמשו ב־82 אלף דוגמאות, אבל הגרסה הציבורית כוללת 69 אלף רשומות בלבד. החלוקה הפנימית במאגר מסודרת לקובצי train ו־validation בפורמט שורות, כשההבדל המספרי נובע מסינון מודע של דוגמאות שלא עמדו בתנאי הפצה חופשיים.

מתאים ל

  • אימון מודל לתיקון דקדוק

    לימוד מודלים לזהות שגיאות תחביר ולהחזיר משפט תקין באנגלית לפי הוראה ישירה.

  • פישוט משפטים מורכבים

    עיבוד טקסטים עמוסים והפיכתם לנגישים יותר תוך שימוש בדוגמאות המוכנות.

  • שינוי משלב וסגנון

    התאמת ניסוחים לטקסט רשמי או פשוט יותר לפי הנחיה מוגדרת מראש.

איפה זה נופל

החיסרון המרכזי הוא שמדובר באנגלית בלבד. אם המטרה היא עריכה בעברית, אין כאן שום מידע רלוונטי. מעבר לזה, חסרות פה כ־13 אלף דוגמאות אימון ועוד כאלף וחצי דוגמאות אימות במשימות של פישוט והעברת משלב רשמי, שהוסרו בגלל מגבלות רישוי. המשמעות היא שהכיסוי למשימות האלה חלש יותר בהשוואה לתוצאות שהוצגו במאמר המקורי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים שמשולבים ביישומים עסקיים. צריך רק להקפיד לכלול את תנאי הרישיון והודעת הייחוס המקורית בהפצה של המאגר או תוצריו הישירים.

האם המאגר כולל תמיכה בעברית?

לא. כל הדוגמאות וההוראות כתובות באנגלית בלבד. אם יש צורך בתיקון עריכה בעברית, המאגר הזה לא יספק את המענה.

למה הגרסה הזו קטנה יותר ממה שמופיע במאמר?

במאמר נעשה שימוש ב־82 אלף רשומות, אבל כ־14.5 אלף מתוכן הוסרו בגלל בעיות רישוי של המקורות. הגרסה הציבורית מכילה רק 69 אלף רשומות שנאספו ממאגרים ציבוריים שמותר לחלוק בחופשיות.

איך טוענים

טוענים את המאגר ישירות בעזרת ספריית datasets או בקריאת קובצי train.jsonl ו־validation.jsonl. אין כאן צורך באישור גישה מיוחד, וההורדה מיידית. בזמן העיבוד צריך לשים לב לשדה src, שמכיל גם את ההוראה וגם את הטקסט המקורי כמקשה אחת, ולכן אם רוצים להפריד ביניהם לאימון שונה נדרש פירוק של המחרוזת לפי המבנה.

from datasets import load_dataset

ds = load_dataset("grammarly/coedit")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולאמן עליו מודלים למוצר סופי. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים של היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗