GPT
C

chatgpt_paraphraser_on_T5_base

קוד פתוח

humarinopenrail2023-03-17

  • transformers
  • pytorch
  • safetensors
  • t5
  • text2text-generation

הוא לוקח משפטים באנגלית ומנסח אותם מחדש בסגנון של ChatGPT, בלי שתצטרכו לשלם על כל קריאה. מודל קומפקטי שמתאים כשרוצים ניסוח מהיר ומקומי למשימה אחת בלבד.

  • 223Mפרמטרים
  • 512טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 15,960הורדות בחודש

מה זה

מדובר בהתאמה של T5-base, שאומנה על דאטה-סט ייעודי של ניסוחים מחדש שהופקו מ־ChatGPT. המקורות לטקסטים הגיעו ממאגרי שאלות של Quora, קטעי מידע מ־SQUAD 2.0 וכתבות חדשותיות של CNN. המטרה פה מאוד ממוקדת: אתם נותנים לו משפט או פסקה קצרה באנגלית, והוא מחזיר כמה וריאציות ניסוח שונות.

במקום להחזיק מודל ענק שיודע לעשות הכל מהיסטוריה ועד קוד, יש כאן ארכיטקטורה ישנה ומוכרת שמכוונת רק לשכתוב. הדאטה עבר זיקוק דרך ChatGPT, כך שהתוצאות מנסות לחקות את הניסוח הרהוט שלו, אבל בתוך מעטפת של 223 מיליון פרמטרים בלבד.

מתאים ל

  • גיוון ניסוחי שאלות

    יצירת גרסאות שונות של אותה שאלה באנגלית כדי להרחיב מאגרי אימון של צ'אטבוטים.

  • עריכת תוכן קצר

    שכתוב כותרות, פסקאות פתיחה או תיאורים קצרים באנגלית כדי לבחור את הניסוח הטוב ביותר.

  • בדיקות A/B לטקסטים

    הפקת כמה חלופות קריפיות לעותקים שיווקיים קצרים ישירות במערכת פנימית בלי עלות פר קריאה.

איפה זה נופל

הבעיה הבולטת ביותר היא אורך הטקסט. בזמן האימון הגבילו את האורך ל־128 טוקנים, וחלון ההקשר המלא מגיע רק ל־512 טוקנים. אם תזינו פסקה ארוכה, הוא פשוט יחתוך אותה או יאבד את הצפון. בנוסף, המודל אומן על אנגלית בלבד, כך שעבור עברית הוא חסר תועלת לחלוטין.

רואים בדוגמאות של היוצרים עצמם שהוא עלול לשנות עובדות עדינות או לחתוך משפטים באמצע, כמו המצאת תאריכים סותרים או משפט שנגמר במילה בודדת. חייבים לבדוק את הפלט שלו ולא לסמוך עליו בעיניים עצומות.

שאלות
נפוצות

האם המודל תומך בשכתוב טקסטים בעברית?

לא. המודל אומן על נתונים באנגלית בלבד מחומרי Quora, SQuAD ו־CNN. הרצה שלו על טקסט בעברית תניב פלט משובש או חסר משמעות לחלוטין.

כמה משאבים צריך כדי להריץ אותו בפרודקשן?

המודל שוקל 1.7 גיגה-בייט ומכיל 223 מיליון פרמטרים. שרת פשוט עם מעבד גרפי צנוע יספיק לעבודה מהירה, ואפשר להסתדר גם על שרת CPU סטנדרטי אם נפח הבקשות נמוך.

האם הוא מתאים לשכתוב של מסמכים שלמים?

לא. המודל הוגבל באימון ל־128 טוקנים ותומך בעד 512 טוקנים בסך הכל. הוא מיועד למשפטים בודדים או לפסקאות קצרות מאוד, ולא מסוגל לטפל במאמרים ארוכים.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.7 גיגה-בייט, מה שאומר שאפשר להריץ אותו בלי בעיה על כמעט כל מעבד גרפי פשוט, ואפילו ישירות על CPU במחשב פיתוח או בשרת קטן. אין פה חלוקה לגרסאות שונות, יש רק את המשקלים האלה בספריית transformers.

אם אתם צריכים לשכתב כמה אלפי משפטים ביום בתוך תהליך קיים, להרים אותו עצמאית זה זול ומהיר. אם אתם צריכים לטפל במאמרים שלמים, בהקשרים ארוכים או בשפות אחרות, אין היגיון להתעסק איתו ועדיף לפנות ל־API חיצוני של מודל גדול ומודרני יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="humarin/chatgpt_paraphraser_on_T5_base")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון openrail. הרישיון הזה בדרך כלל מאפשר שימוש חופשי, כולל מטרות מסחריות, אבל מטיל מגבלות שימוש ספציפיות שנועדו למנוע שימוש פוגעני או לא חוקי. אם אתם מתכננים להטמיע אותו במוצר שלכם, צריך לבדוק את תנאי הרישיון המדויקים ולוודא שהיישום שלכם לא נופל באחד התחומים האסורים.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗