GPT
S

small100

קוד פתוח

alirezamshmit2022-11-01

  • transformers
  • pytorch
  • onnx
  • safetensors
  • m2m_100

תרגום מכונה מהיר בין מאה שפות שרץ מקומית בלי לבלוע משאבים. הוא נותן חלופה קלה למי שרוצה להימנע מעלויות ענן וספקי צד שלישי.

  • 333Mפרמטרים
  • 1,024טוקנים בהקשר
  • 4.2 GBמשקל הקבצים
  • 21,920הורדות בחודש

מה זה

מדובר במודל תרגום שמבוסס על הארכיטקטורה של M2M-100, אבל עבר צמצום משמעותי כדי לעבוד מהר יותר ובפחות זיכרון. הוא מכסה מעל 10,000 צמדי שפות שונים, כולל עברית, ערבית ושפות אירופיות ונפוצות אחרות, ומתרגם ישירות משפת מקור לשפת יעד בלי להעביר את הטקסט קודם דרך אנגלית.

עם 333 מיליון פרמטרים ו־12 שכבות, הוא תוכנן לעמוד בביצועים שמתחרים בגרסה המקורית תוך קיצוץ זמני הריצה. הקבצים שוקלים 4.2 גיגהבייט בגלל שמירה בדיוק float32, כך שיש כאן מודל ייעודי קלאסי למשימת תרגום נקייה, בלי השומן המיותר של מודלי שפה ענקיים.

מתאים ל

  • תרגום ממשקים ועמודי אתר

    מתאים ללוקליזציה של מחרוזות קצרות וטקסטים פשוטים במערכות מרובות שפות בלי תלות ברשת חיצונית.

  • עיבוד טקסט פנימי מאובטח

    מאפשר לתרגם מידע רגיש בארגון ישירות על השרת המקומי בלי לשלוח נתונים לענן של חברות צד שלישי.

  • צינורות נתונים מרובי שפות

    רץ מהר על מעבדים פשוטים ומתאים לנרמול טקסטים משפות שונות לפני ניתוח או סיווג אוטומטי.

איפה זה נופל

חלון ההקשר מוגבל ל־1,024 טוקנים, וההמלצה בהפקה היא להגביל את הפלט ל־256 טוקנים עם beam size של 5. זה אומר שהוא מתאים למשפטים ולפסקאות קצרות, אבל לא למסמכים שלמים או ספרים. הטוקנייזר שלו דורש טעינה מקומית מקובץ נפרד ולא כחלק אינטגרלי מהחבילה הרגילה, מה שמוסיף תחזוקה ידנית בקוד.

שאלות
נפוצות

האם המודל תומך בתרגום ישיר לעברית וממנה?

כן, עברית מופיעה ברשימת מאה השפות הנתמכות, והוא מתרגם ישירות בינה לבין שאר השפות בלי צורך בתרגום ביניים לאנגלית.

מה נדרש כדי להריץ את המודל בפייתון?

צריך להתקין את ספריית transformers ואת חבילת sentencepiece, ולהוריד את קובץ הטוקנייזר הייעודי שפורסם יחד עם המודל.

איך מריצים

טוענים את המודל ישירות מספריית transformers בעזרת המחלקה M2M100ForConditionalGeneration, ומשתמשים בקובץ הטוקנייזר המותאם שדורש התקנה של sentencepiece. בגלל הגודל הצנוע, אפשר להריץ אותו בקלות על כרטיס מסך בסיסי או אפילו על מעבד רגיל בשרת פשוט.

אם אתם צריכים תרגום של כמה משפטים ביום, כנראה שעדיף לקרוא ל־API חיצוני ולא לתחזק שרת. המודל הזה משתלם כשאתם רוצים לעבד כמויות גדולות של טקסט בלי לשלם לפי טוקן ובלי להוציא מידע מחוץ לרשת שלכם.

from transformers import pipeline

pipe = pipeline("translation", model="alirezamsh/small100")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא. אתם יכולים להשתמש בו לצרכים מסחריים, לשנות את הקוד ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗