GPT
M

madlad400-10b-mt

קוד פתוח

googleapache-2.02023-11-27

  • transformers
  • safetensors
  • gguf
  • t5
  • text2text-generation

מודל תרגום ענק שמכסה יותר מ־450 שפות ומיועד למי שצריך תרגום מקומי בלי תלות ברשת. הוא נבנה על ארכיטקטורת T5 ומתחרה בביצועים של מודלים כבדים בהרבה.

  • 11Bפרמטרים
  • 512טוקנים בהקשר
  • 53.7 GBמשקל הקבצים
  • 4,264הורדות בחודש

מה זה

גוגל אימנו את המודל הזה על 250 מיליארד טוקנים כדי לספק מענה למאות שפות, בעיקר כאלו שלא זוכות לייצוג במאגרי מידע גדולים. הוא מבוסס על ארכיטקטורת T5 עם 32 שכבות ומשתמש בטוקנייזר משותף שמכיל 256 אלף טוקנים. כדי לקבוע את שפת היעד, פשוט מוסיפים תגית ייעודית בתחילת הטקסט.

בניגוד למודלי שיחה כלליים שמנסים לעשות הכל, כאן מדובר בכלי שממוקד כולו במשימת תרגום מכונה. הוא אומן על שילוב של טקסטים מהרשת ומקורות מקבילים ב־157 שפות, מה שמאפשר לו להתמודד עם מגוון רחב של שפות נדירות לצד השפות הנפוצות.

מתאים ל

  • תרגום לשפות נדירות

    הוא אומן על מעל 450 שפות, כולל שפות רבות שאינן נתמכות במודלים מסחריים רגילים.

  • מחקר בלשני ועיבוד שפה

    המבנה שלו וגודל אוצר המילים מתאימים לבדיקת ביצועי תרגום והשוואת שפות בתנאי מעבדה.

  • מערכות תרגום מקומיות

    מאפשר לעבד טקסטים רגישים בתוך שרת פנימי ומאובטח בלי לשלוח מידע לשירותי ענן חיצוניים.

איפה זה נופל

גוגל בדקו את הביצועים רק על 204 שפות מתוך יותר מ־450 הנתמכות, כך שאיכות התרגום בשאר השפות אינה מובטחת. הנתונים נאספו מסריקת רשת, ולכן הפלט עלול להכיל תוכן פוגעני, רעיל או ברמה נמוכה. חלון ההקשר מוגבל ל־512 טוקנים, מה שחוסם תרגום מסמכים ארוכים ברצף ללא חלוקה מוקדמת. המפתחים מצהירים שהמודל מיועד למחקר ולא נבדק בסביבות ייצור.

שאלות
נפוצות

איך מציינים למודל לאיזו שפה לתרגם את הטקסט?

השליטה בשפת היעד מתבצעת בעזרת תגית קצרה בתחילת הקלט. מוסיפים את קוד השפה בתוך סוגריים משולשים, כמו תגית ייעודית לפורטוגזית, והמודל מייצר את הפלט בהתאם.

האם המודל מתאים לתרגום טקסטים מקצועיים כמו רפואה או משפטים?

האימון נעשה על מידע כללי שנאסף מהרשת ללא התאמה לתחומים ייעודיים. הכרטיס מציין בפירוש שהכלי אינו מיועד לשימוש מקצועי ספציפי ללא התאמה נוספת ובדיקה קפדנית.

איך מריצים

כדי להריץ אותו בסביבת פייתון צריך להתקין את transformers, accelerate ו־sentencepiece. הקבצים שוקלים 53.7 GB בפורמט float32, כך שצריך כרטיס מסך חזק מאוד עם זיכרון ייעודי גדול, או לחלופין לחלק את המשקלים בין כמה מעבדים גרפיים באמצעות device_map אוטומטי.

קיימת גם אפשרות הרצה ב־Rust דרך ספריית candle לחסכון במשאבים. אם אין לכם שרת ייעודי עם חומרה מתאימה לנפח כזה, הניסיון לטעון 53.7 GB לזיכרון מקומי יהיה איטי ויקר מדי בהשוואה לשירות מנוהל.

ollama run hf.co/google/madlad400-10b-mt:Q4K

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והצהרת ויתור אחריות של המפתחים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗