GPT
M

modernbert-ja-130m

קוד פתוח

sbintuitionsmit2025-02-06

  • transformers
  • safetensors
  • modernbert
  • fill-mask
  • ja

מודל אנקודר קומפקטי ביפנית ובאנגלית עם חלון של 8,192 טוקנים. הוא נותן דיוק של מודלים כבדים בהרבה ומיועד למי שצריך קלסיפיקציה מהירה לטקסט ארוך.

  • 133Mפרמטרים
  • 8,192טוקנים בהקשר
  • 514 MBמשקל הקבצים
  • 124,335הורדות בחודש

מה זה

זה מודל מסוג ModernBERT שאומן מראש על 4.39 טריליון טוקנים ביפנית ובאנגלית. המבנה שלו משלב מנגנון קשב מקומי וגלובלי יחד עם שילוב מיקום מסוג RoPE, מה שמאפשר לו להחזיק רצפים ארוכים בלי להתנפח בזמני החישוב. מילון המודל מכיל 102,400 מילים ומבוסס על SentencePiece עם מודל שפה unigram, כך שאפשר להזין טקסט גולמי ישירות ללא צורך במנתח מורפולוגי מקדים ליפנית.

במבחני ביצועים על 12 מאגרי נתונים ביפנית, המודל השיג ציון ממוצע של 88.95 נקודות. המשמעות בפועל היא שהוא עוקף מודלים גדולים ממנו כמו Tohoku BERT-large שכולל 337 מיליון פרמטרים, ומציג תוצאות דומות ל־LUKE-japanese-large-lite שמגיע ל־414 מיליון פרמטרים. היתרון שלו בולט בעיקר במשימות ידע כמו JCommonsenseQA, שם הוא עומד על 91.01 אחוזי דיוק, לצד ביצועים יציבים במשימות קצרות למרות ההתאמה שלו לקלט ארוך.

מתאים ל

  • סיווג מסמכים ארוכים

    תמיכה ברצפים של 8,192 טוקנים מאפשרת לקטלג מאמרים ודוחות שלמים ביפנית בלי לחתוך את הטקסט.

  • זיהוי רעילות ותוכן

    הוא מגיע ל־91.57 אחוזי דיוק במאגר LLM-jp Toxicity, ומתאים לניטור תגובות וטקסטים בזמן אמת.

  • בדיקת דמיון סמנטי

    עם ציון של 89.20 במדד JSTS, המודל מעולה להשוואת משמעות בין משפטים ושאילתות ביפנית.

איפה זה נופל

המודל מיועד למילוי מסכות ולהתאמה למשימות סיווג, והוא לא מסוגל לייצר טקסט חופשי. אם המטרה היא צ'אט או כתיבה יוצרת, הוא פשוט לא יעבוד. בנוסף, בגלל השימוש בטוקנייזר unigram, החלוקה לטוקנים לא תואמת במקרים רבים לגבולות המורפולוגיים של השפה היפנית. היוצרים מציינים במפורש שהדבר פוגע בדיוק במשימות של סיווג ברמת הטוקן, כמו זיהוי ישויות שמיות או חילוץ מקטעים. צריך גם לקחת בחשבון שהאימונים כללו מידע רב מהרשת, ולכן הייצוגים עלולים להכיל הטיות או ביטויים פוגעניים במשימות מסוימות.

שאלות
נפוצות

האם המודל מסוגל לייצר תשובות כמו ChatGPT?

לא, הארכיטקטורה שלו מבוססת אנקודר בלבד ומיועדת למילוי מסכות או סיווג. בשביל יצירת טקסט חופשי ביפנית צריך מודלים מסוג דקודר, למשל סדרת Sarashina של אותה חברה.

איך המודל מתמודד עם טקסט מעורב ביפנית ובאנגלית?

הוא אומן על קורפוס שמשלב את שתי השפות ומכיל מילון רחב במיוחד של 102,400 מונחים. בזכות זה הוא מטפל היטב בקלטים דו לשוניים בלי צורך בהפרדה מקדימה.

למה הביצועים שלו פחות טובים בזיהוי שמות וישויות?

חלוקת הטוקנים של SentencePiece אינה עוקבת אחרי המבנה המורפולוגי של השפה היפנית. כתוצאה מכך מילים שלמות עלולות להיחתך בצורה לא טבעית, מה שמקשה על משימות תיוג מילים.

איך מריצים

ההרצה נעשית ישירות דרך ספריית transformers מגרסה 4.48.0 ומעלה. אם יש לכם מאיץ גרפי שתומך ב־Flash Attention 2, שווה להתקין את התוסף כדי ליהנות מניצול זיכרון נמוך בהרבה בקלטים ארוכים. המודל שוקל 514 מגה בייט בלבד, ולכן כל כרטיס מסך בסיסי או אפילו מעבד סטנדרטי יריצו אותו בלי בעיה בזמן אינפרנס מקומי.

בסדרה הזו קיימים גם גדלים של 30 מיליון, 70 מיליון ו־310 מיליון פרמטרים. הגרסה הזו יושבת באמצע ומציעה את יחס הביצועים הטוב ביותר מול משאבים, כך שאין שום סיבה לשלם על קריאות ל־API חיצוני. מריצים אותו מקומית בתוך השרת שלכם וחוסכים עלויות שוטפות לחלוטין.

from transformers import pipeline

pipe = pipeline("fill-mask", model="sbintuitions/modernbert-ja-130m")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 514 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, לאמן אותו מחדש ולשלב אותו במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור של המפתח המקורי בתוך הקוד או ההפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗