GPT
C

coedit-large

קוד פתוח

grammarlycc-by-nc-4.02023-05-11

  • transformers
  • pytorch
  • safetensors
  • t5
  • text2text-generation

יש כאן גם סקירה על Grammarly עצמו.

זהו כוונון של גוגל פלאן עבור עריכת טקסט והגהה לפי הוראה מפורשת. הוא שוקל פחות ממיליארד פרמטרים ומתאים למי שרוצה בקרת ניסוח מקומית באנגלית בלי להעמיס מודל ענק.

  • 783Mפרמטרים
  • 512טוקנים בהקשר
  • 5.8 GBמשקל הקבצים
  • 3,029הורדות בחודש

מה זה

גרמרלי לקחו את המודל פלאן טי חמש לארג' של גוגל ואימנו אותו מחדש על מאגר נתונים ייעודי לפעולות עריכה. הרעיון כאן הוא לא שיחה פתוחה ולא יצירת תוכן מאפס, אלא משימות תחומות מאוד. אתם מספקים לו הוראה כמו תיקון דקדוק, פישוט משפט או שכתוב, יחד עם הטקסט המקורי, והוא פולט גרסה ערוכה שתואמת לבקשה.

בגודל של שבע מאות שמונים ושלושה מיליון פרמטרים הוא שונה ממודלי שפה כלליים בכך שהוא ממוקד כולו בעיבוד קלט קיים. במקום להיאבק בפרומפטים ארוכים במודלים של עשרות מיליארדי פרמטרים רק כדי לתקן פסיק או זמנים באנגלית, מקבלים כאן כלי ממוקד שעושה בדיוק את העבודה הזו ישירות מתוך ספריית הטרנספורמרס המוכרת.

המשקל שלו עומד על כמעט שישה גיגה בייט בדיוק מלא, מה שהופך אותו לגרסה הקלה ביותר במשפחה שכוללת גם דגמים של שלושה מיליארד ואחד עשר מיליארד פרמטרים. אם המטרה היא עריכה תחבירית מוגדרת בלי יומרה לייצר פסקאות חדשות, המבנה הזה נותן מענה יעיל יחסית.

מתאים ל

  • תיקון שגיאות כתיב באנגלית

    זיהוי בעיות דקדוק ואיות בקטעים קצרים ותרגומם לניסוח תקין לפי הוראה ברורה.

  • פישוט משפטים מורכבים

    שכתוב פסקאות קצרות כדי שיהיו קריאות ונגישות יותר לקוראים ללא רקע טכני.

  • מחקר על עריכת טקסט

    בדיקת ביצועים של מודלי שפה ייעודיים לעריכה בסביבה אקדמית שאינה דורשת רישוי מסחרי.

איפה זה נופל

חלון ההקשר מוגבל לחמש מאות ושנים עשר טוקנים בלבד. אי אפשר לזרוק עליו מסמכים שלמים, מאמרים או פסקאות ארוכות, והוא מיועד למשפטים בודדים או קטעים קצרים מאוד. בנוסף, המודל אומן על אנגלית בלבד. בעברית אין מה לנסות להשתמש בו כלל. אם ההוראה מנוסחת בצורה עמומה, הוא עלול לשנות את משמעות המשפט במקום רק לתקן שגיאות.

שאלות
נפוצות

האם המודל מסוגל לטפל בטקסטים בעברית?

לא. המודל הוגדר ואומן על השפה האנגלית בלבד. הוא לא יזהה מבנים תחביריים בעברית ולא יבצע בה תיקונים נכונים.

אפשר לערוך איתו עמוד שלם של טקסט בבת אחת?

לא. מגבלת הקלט היא חמש מאות ושנים עשר טוקנים בלבד. כדי לערוך טקסט ארוך תצטרכו לפרק אותו למשפטים בודדים ולהעביר אותם בזה אחר זה.

האם מותר להטמיע אותו במוצר של החברה שלי?

לא, הרישיון שבו הוא פורסם אוסר כל שימוש מסחרי. מותר להשתמש בו למחקר, ניסויים פנימיים או פרויקטים אישיים בלבד.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך בסיסי עם לפחות שמונה גיגה זיכרון כדי לטעון את כל המשקלים שלו בצורה נוחה. הקוד דורש רק ייבוא פשוט של הטוקנייזר והמודל מתוך ספריית טרנספורמרס, ומעבירים אליו את ההוראה והטקסט במחרוזת אחת ישירות לפונקציית הג'נרייט.

הגרסה הזו היא הקטנה בסדרה. הגרסאות של שלושה או אחד עשר מיליארד פרמטרים ידרשו חומרה כבדה ויקרה בהרבה. אם אתם צריכים רק תיקוני טקסט נקודתיים בהיקף נמוך, הרמת שרת ייעודי עבורו עשויה להיות מוגזמת ועדיף לפנות למודל מרוחק, אבל לפעולות פנימיות שדורשות פרטיות הוא רץ בקלות על חומרה מקומית סבירה.

from transformers import pipeline

pipe = pipeline("text-generation", model="grammarly/coedit-large")
print(pipe("שלום"))

הרישיון

הרישיון הוא סי סי בי וואי אן סי ארבע נקודה אפס. המשמעות היא איסור מוחלט על שימוש מסחרי מכל סוג שהוא. מותר להוריד, לחקור, לשנות ולהריץ אותו לצרכים פרטיים, לימודיים או מחקריים בלבד, תוך מתן קרדיט מתאים. אם המטרה היא לשלב אותו בתוך מוצר שמוכר שירות או מניב הכנסה, המודל הזה פסול לשימוש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗