GPT
M

jbochi/madlad400-3b-mt

קוד פתוח

jbochiapache-2.02023-09-21

  • transformers
  • safetensors
  • gguf
  • t5
  • text2text-generation

המודל מתרגם בין יותר מ־450 שפות על בסיס ארכיטקטורת T5 עם 3 מיליארד פרמטרים. הוא מיועד למי שמחפש כיסוי שפות נדירות במודל קומפקטי יחסית בלי להסתמך על שירותי ענן סגורים.

  • 2.9Bפרמטרים
  • 512טוקנים בהקשר
  • 14.6 GBמשקל הקבצים
  • 2,349הורדות בחודש

מה זה

מדובר במודל תרגום מכונה רב-לשוני שאומן על טריליון טוקנים ממאגרים ציבוריים, ומכסה מעל 450 שפות. המשקלים כאן הם המרה של המחקר המקורי לפורמט שרץ ישירות בספריית transformers, כשכל הפרמטרים משותפים לכל השפות דרך מילון Sentence Piece של 256 אלף טוקנים.

היתרון המרכזי שלו מול מודלים אחרים בגודל הזה הוא רוחב היריעה. רוב המודלים הקטנים מתמקדים בעשרות שפות בודדות, וכאן מקבלים תמיכה גם בשפות עם מעט מאוד מידע ברשת. השליטה בשפת היעד מתבצעת פשוט על ידי הוספת תגית קצרה בתחילת הקלט.

מתאים ל

  • תרגום שפות נדירות

    מתאים לשפות שאינן נתמכות במודלים מסחריים נפוצים, בזכות אימון רחב על מאות שפות במקביל.

  • עיבוד מקומי ופרטי

    מאפשר תרגום נתונים רגישים בתוך הרשת הארגונית בלי להוציא מידע לשרתים של צד שלישי.

  • שילוב במערכות קלות

    באמצעות גרסת Candle המכווצת ל־1.65 גיגה, אפשר לשלב תרגום מקומי על חומרה צנועה יחסית.

איפה זה נופל

האימון נעשה על מידע כללי מהרשת, כך שהמודל לא מיועד לטקסטים מקצועיים ורפואיים מהקופסה. בנוסף, מתוך יותר מ־450 שפות נתמכות, החוקרים העריכו את הביצועים על 204 שפות בלבד, ויש פערי איכות ניכרים ביניהן. חלון ההקשר מוגבל ל־512 טוקנים, מה שדורש לחתוך טקסטים ארוכים מראש. מאחר שחומרי האימון הגיעו מסריקת רשת, הפלטים עלולים לכלול ניסוחים רעילים או מוטים בתחומים מסוימים, והכרטיס מציין במפורש שהוא לא נבדק לתרחישי ייצור.

שאלות
נפוצות

איך מגדירים לאיזו שפה המודל צריך לתרגם?

מוסיפים תגית של שפת היעד בתחילת המחרוזת שנשלחת לטוקנייזר, למשל הסימון לשפה הגרמנית או הפורטוגזית לפני הטקסט עצמו. המודל מזהה את התגית הזו ומייצר את הפלט בשפה המבוקשת בהתאם.

האם המודל מתאים לתרגום מסמכים וחוזים ארוכים?

לא מומלץ להזין מסמכים שלמים בבת אחת בגלל מגבלת הקשר של 512 טוקנים. תצטרכו לפרק את הטקסט למשפטים או פסקאות קצרות, ולקחת בחשבון שהוא לא אומן על מינוח משפטי ייעודי.

איך מריצים

כדי להריץ אותו דרך פייתון וספריית transformers תצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון, שכן המשקלים הלא-מכווצים תופסים 14.6 גיגה דיסק. ההרצה דורשת התקנה של accelerate ו־sentencepiece לצד החבילה הרגילה.

מי שרוצה לחסוך משאבים יכול להשתמש בספריית Candle ב־Rust עם גרסת GGUF מכווצת שמקצצת את המשקל ל־1.65 גיגה בלבד, מה שמאפשר הרצה מקומית קלה בהרבה. אם המטרה היא לתרגם רק אנגלית, צרפתית וספרדית בנפחים נמוכים, קריאה ל־API חיצוני פשוט תחסוך לכם תחזוקת שרת.

ollama run hf.co/jbochi/madlad400-3b-mt:Q3K

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש בלי תשלום תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים. אפשר לשלב אותו במוצר מסחרי כל עוד עומדים בדרישות התיעוד הללו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗