GPT
B

byt5-small

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • t5

מודל שעובד ישירות על בייטים של טקסט בלי טוקנייזר בכלל. הוא מיועד למי שמתמודד עם שפות מגוונות או טקסט מלוכלך במיוחד עם שגיאות הקלדה ועיוותים.

  • 3.3 GBמשקל הקבצים
  • 347,214הורדות בחודש
  • 106לייקים

מה זה

הארכיטקטורה מבוססת על T5 ועל MT5, אבל ההבדל הגדול הוא חוסר התלות במילון מוגדר מראש. במקום לפצל מילים לתת-מילים, הוא קורא ופולט ישירות רצפי UTF-8. זה מבטל את הצורך לנהל מילוני מונחים נפרדים או להיתקע עם מילים לא מוכרות שמוחלפות בתווים ריקים.

הוא עבר אימון מקדים על מאגר mC4 בלבד ללא שום אימון מונחה, עם מיסוך של רצפי בייטים באורך ממוצע של 20 תווים. המטרה כאן היא לתת בסיס עמיד לרעשים, והוא מציג עליונות ברורה על פני mt5-small במשימות כמו מענה על שאלות מתוך טוויטר, איפה שהשפה שבורה, מלאה בסלנג ובקיצורים.

מתאים ל

  • טיפול בטקסטים מלוכלכים

    מתאים לניתוח טקסט שמגיע מרשתות חברתיות, עם שגיאות כתיב וסלנג שמכשילים טוקנייזרים רגילים.

  • עבודה מרובת שפות

    מעבד כל שפה שמקודדת ב־UTF-8 ישירות, כולל שפות עם אלפבית שונה, בלי לחתוך מילים בצורה מעוותת.

  • משימות תיקון שגיאות והקלדה

    רמת הבייטים מאפשרת לו לזהות טעויות איות מדויקות ברמת התו הבודד.

איפה זה נופל

הוא לא מודל מוכן לשימוש ישיר מהקופסה. בגלל שהוא עבר רק אימון מקדים כללי ולא אימון מונחה למשימה מסוימת, אי אפשר פשוט לתת לו פקודה ולקבל תשובה בלי לעשות לו קודם פיין טיונינג על דאטה סט ייעודי. בנוסף, עבודה ברמת בייטים מייצרת רצפים ארוכים בהרבה מאשר עבודה עם טוקנים רגילים, מה שמשפיע ישירות על זמני החישוב בריצות ארוכות.

שאלות
נפוצות

אפשר להשתמש בו ישירות לצ'אט או לתשובות?

לא. המודל עבר אימון מקדים בלבד על מילוי רצפים חסרים, ולכן הוא לא יודע לענות על שאלות או לנהל שיחה ככה סתם. חייבים לאמן אותו עם דוגמאות של קלט ופלט למשימה הספציפית שאתם צריכים.

האם אני חייב להשתמש בטוקנייזר שלו?

לא חייבים. אפשר פשוט להמיר מחרוזת לרשימת בייטים ב־UTF-8, להוסיף 3 לערכים כדי לפנות מקום לתווי שליטה מיוחדים, ולהזין את הטנזור ישר למודל. השימוש בטוקנייזר מומלץ בעיקר כדי לסדר ריפוד לאצוות של טקסטים באורכים שונים.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.3 ג'יגה בייט, כך שאפשר להעלות אותו בלי בעיה על מחשב מקומי סביר או כרטיס מסך פשוט עם כמה גיגות של זיכרון דרך ספריית transformers. מזינים לו ישירות רצף בייטים מקודד כטנזור, אם כי לעבודה על אצוות עדיין אפשר להשתמש במחלקה ייעודית לצורך פדינג.

ברמת התשתית זה קל לתחזוקה עצמית ולא דורש שרתים מנופחים. בגלל הגודל הקומפקטי שלו, הרצה מקומית תהיה זולה ופשוטה יותר מלהסתמך על ספקי API חיצוניים, בהנחה שאתם מוכנים לאמן אותו קודם.

from transformers import pipeline

pipe = pipeline("text-generation", model="google/byt5-small")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש חופשי כולל שימוש מסחרי מלא, שינוי הקוד והפצה מחדש במוצרים סגורים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗