GPT
R

ruri-v3-310m

קוד פתוח

cl-nagoyaapache-2.02025-04-09

  • safetensors
  • modernbert
  • sentence-similarity
  • feature-extraction
  • ja

מודל שיכוך ייעודי ליפנית שנשען על ModernBERT ותומך בטקסטים ארוכים. הוא עוקף בביצועים ביפנית גם מודלים של מיליארד פרמטרים וגם שירותים מסחריים מוכרים.

  • 315Mפרמטרים
  • 8,192טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 505,942הורדות בחודש

מה זה

מדובר במודל הטקסט הגדול ביותר בסדרת Ruri v3, שנועד לייצר וקטורים מייצגים עבור השפה היפנית בממד 768. הוא בנוי על גבי ModernBertModel, מה שמאפשר לו להשתמש באוצר מילים מורחב של מאה אלף טוקנים ובמנגנון FlashAttention. השינוי המרכזי מול גרסאות עבר הוא פירוק טקסט ישיר בעזרת SentencePiece, בלי צורך בכלים חיצוניים לחיתוך מילים ביפנית.

במבחני JMTEB המודל משיג ציון ממוצע של 77.24, הנתון הגבוה ביותר ברשימת ההשוואה בכרטיס. הוא עוקף שם מודלים ייעודיים גדולים בהרבה כמו sarashina-embedding עם 1.22 מיליארד פרמטרים שקיבל 75.50, ואת text-embedding-3-large של OpenAI שעומד על 73.97. היתרון המשמעותי שלו מופיע באחזור מידע עם ציון של 81.89, לעומת 74.48 בלבד של OpenAI.

מתאים ל

  • אחזור מסמכים ביפנית

    מתאים למנועי RAG וחיפוש פנימי ביפן, שם ציון האחזור של 81.89 עוקף חלופות מסחריות גדולות.

  • עיבוד מאמרים ארוכים

    חלון של 8,192 טוקנים מאפשר להמיר מסמכים שלמים בלי לחתוך אותם לפסקאות קצרות.

  • דירוג מחדש וסמנטיקה

    תוצאה של 93.43 במשימות Reranking הופכת אותו לשלב סינון מדויק מעל תוצאות חיפוש ראשוניות.

איפה זה נופל

המודל מאומן עבור יפנית בלבד. הוא לא מיועד לעברית, לאנגלית או לכל תרחיש רב לשוני, ואסור לבנות עליו לפרויקט שלא מתמקד ביפן. נקודת חולשה ברורה שמופיעה בנתונים היא משימת הקלסטרינג, שבה הוא משיג 55.69 בלבד, וסיווג זוגות שנעצר ב־62.60. בנוסף, חלון של 8,192 טוקנים דורש בדיקת זיכרון מעשית על מסמכים ארוכים באמת, בעיקר אם לא מפעילים האצת FlashAttention.

שאלות
נפוצות

האם המודל מתאים לטקסטים בעברית או באנגלית?

לא. המודל מאומן ספציפית ליפנית ומסתמך על מודל בסיס ייעודי לשפה זו. חיפוש או שיכוך של עברית יניבו תוצאות שגויות, ולמשימות כאלה עדיף לבחור מודל רב לשוני כמו סדרת multilingual-e5.

איזו חומרה נדרשת להרצה בייצור?

המודל שוקל 1.2 גיגה בייט בלבד. כרטיס מסך פשוט יחסית, כמו כרטיס עם 8 גיגה בייט זיכרון, יריץ אותו בקלות. אם מוסיפים תמיכה ב־FlashAttention 2, המהירות תעלה משמעותית גם על עומסי פניות גבוהים.

איך מריצים

כדי להריץ אותו צריך transformers בגרסה 4.48.0 ומעלה יחד עם ספריית sentence-transformers. על מעבדים גרפיים שתומכים בזה, התקנה של flash-attn תשפר את זמני הריצה. המודל שוקל 1.2 גיגה בייט בלבד, כך שכרטיס מסך בסיסי עם כמה גיגה בייט של זיכרון יספיק לחלוטין לעיבוד מקומי.

בסדרה קיימות גרסאות קטנות יותר, החל מ־37 מיליון פרמטרים ועד 132 מיליון פרמטרים. אם זמן התגובה או משאבי המחשוב קריטיים, גרסת ה־130M מציגה ציון אחזור זהה לחלוטין של 81.89 במחיר של ירידה קלה במשימות אחרות. אין צורך לפנות ל־API חיצוני כשהמשקל כה נמוך והחומרה הנדרשת זולה מאוד.

pip install -U huggingface_hub
hf download cl-nagoya/ruri-v3-310m

הקבצים

46 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל למוצרים מסחריים, לשנות אותו, להריץ אותו בשרתים פנימיים או לשלב אותו בקוד סגור, בלי לשלם תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗