GPT
M

mengzi-t5-base

קוד פתוח

Langboatapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • t5
  • text2text-generation

מודל T5 קומפקטי שאומן מראש על טקסט סיני בלבד. הוא מתאים למי שצריך משימות עיבוד שפה ישירות בסינית ורוצה להריץ הכל מקומית בלי שרתים מנופחים.

  • 248Mפרמטרים
  • 1.8 GBמשקל הקבצים
  • 1,378הורדות בחודש
  • 61לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת T5 עם כמאתיים ארבעים ושמונה מיליון פרמטרים, שחברת Langboat אימנה על קורפוס סיני בנפח של 300 גיגה בייט. בשונה מדגמי T5 כלליים שנשענים בעיקר על אנגלית או מכילים תערובת רב לשונית רחבה, כאן כל המשאבים של המודל כוונו לשפה הסינית כבר מההתחלה.

המשמעות בפועל היא יכולת לטפל במשימות המרה מטקסט לטקסט בסינית, כמו תרגום, סיכום או שכתוב, ברמת הבנה מקומית מדויקת יותר ממה שמקבלים בדרך כלל ממודל בינלאומי באותו סדר גודל. הוא לא מגיע עם שכבות של שפות אחרות שתופסות מקום בזיכרון, ולכן הוא נותן מענה ממוקד מאוד למפתחים שעובדים מול השוק הזה.

מתאים ל

  • סיכום טקסטים בסינית

    הוא אומן על מאות גיגות של טקסט סיני ומתאים ליצירת תקצירים קצרים ממסמכים.

  • שכתוב והשלמת משפטים

    מבנה ה־T5 מאפשר לו להמיר ניסוחים ולייצר חלופות טבעיות לטקסט קיים.

  • בסיס לכוונון ייעודי

    הגודל הקל מאפשר לאמן אותו מחדש על דאטה עסקי בסינית במהירות ובזול.

איפה זה נופל

הוא מוגדר לשפה הסינית בלבד. אין לו שום תמיכה בעברית, ואם תזרקו עליו משימות באנגלית תקבלו תוצאות חלקיות או חסרות תועלת.

בנוסף, מדובר במודל בסיס שאומן מראש על טקסט כללי, ולא בכלי שעבר כוונון למשימה מוגדרת. כרטיס המודל לא מציג נתוני ביצועים, מגבלות תוכן או התנהגות מול שגיאות, ולכן תצטרכו לאמן אותו הלאה על הנתונים שלכם ולבדוק את הפלטים בעצמכם.

שאלות
נפוצות

האם הוא יכול לעבוד עם טקסט בעברית?

לא. המודל אומן על קורפוס סיני בלבד והטוקנייזר שלו לא מיועד לאותיות עבריות. אם תנסו לעבד איתו עברית תקבלו פלט שבור.

כמה זיכרון דרוש כדי להריץ אותו?

הקבצים שוקלים 1.8 גיגה בייט. כל כרטיס מסך ביתי בסיסי עם 4 עד 6 גיגה בייט זיכרון יספיק, ואפשר להריץ אותו גם ישירות על זיכרון של מעבד רגיל.

האם אפשר להשתמש בו ישירות לצ'אט?

לא מומלץ. זה מודל בסיס שנועד להמרת טקסט לטקסט ולא כלי שעבר כוונון לשיחה, ולכן כדי לקבל תוצאה סבירה צריך לאמן אותו מראש על משימה ספציפית.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות T5Tokenizer וארכיטקטורת T5ForConditionalGeneration הרגילה. כל המשקלים שלו תופסים 1.8 גיגה בייט בקבצי float32, כך שלא צריך שרת ייעודי כבד כדי להרים אותו.

אפשר להריץ אותו בלי בעיה על מעבד רגיל במחשב פיתוח, או על כרטיס מסך בסיסי עם מעט זיכרון. אם מדובר בכמויות קטנות של טקסט או בבדיקות ראשוניות, הוא עובד מקומית מיד בלי להקים תשתית ענן מורכבת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Langboat/mengzi-t5-base")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 1.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי, כולל שילוב במוצרים מסחריים והפצה מחדש. הדרישה העיקרית היא לשמור על הודעת זכויות היוצרים והרישיון המקורי בקוד או במוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗