GPT
R

ruri-large

קוד פתוח

cl-nagoyaapache-2.02024-08-28

  • safetensors
  • bert
  • sentence-similarity
  • feature-extraction
  • ja

מודל שיעבוד טקסט ייעודי ליפנית, שמפיק וקטורים איכותיים לחיפוש ודיוק דקדוקי. הוא רלוונטי למי שחייב ביצועים חזקים ביפנית ולא רוצה להסתמך על מודלים רב-לשוניים כלליים.

  • 337Mפרמטרים
  • 512טוקנים בהקשר
  • 644 MBמשקל הקבצים
  • 14,626הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת ברט עם 337 מיליון פרמטרים ו־24 שכבות, שתוכנן ונבנה עבור השפה היפנית בלבד. הוא מייצר וקטורים בגודל 1024 ממדים עבור משימות דמיון טקסטואלי, סיווג ושליפת מידע, תוך שימוש בחישוב דמיון קוסינוס.

במבחני JMTEB המודל מציג ציון ממוצע של 73.31, כשהוא עוקף מודלים רב-לשוניים פופולריים כמו סדרת multilingual-e5 וגם מודלים יפניים ייעודיים קודמים כמו GLuCoSE. במשימות דמיון סמנטי הוא מגיע לציון 83.13, ובשליפה ל־73.02. המשמעות היא הבנה טובה בהרבה של ניואנסים, תחביר ואוצר מילים ביפנית בהשוואה למודלים שלא אומנו ספציפית על השפה הזו.

מתאים ל

  • חיפוש סמנטי ביפנית

    שליפת פסקאות מתוך מאגר מסמכים יפני בדיוק גבוה מול שאילתות משתמש.

  • סיווג טקסטים קצרים

    חלוקת ביקורות או פניות שירות ביפנית לקטגוריות על בסיס וקטורים איכותיים.

  • זיהוי כפילויות תוכן

    מדידת דמיון סמנטי בין צמדי משפטים ביפנית עם דיוק STS של מעל 83 נקודות.

איפה זה נופל

המגבלה הראשונה והברורה היא חוסר תמיכה בכל שפה שאינה יפנית. אם תנסו להעביר לו עברית או אנגלית תקבלו תוצאות גרועות. מעבר לכך, אורך הקלט מוגבל ל־512 טוקנים בלבד, מה שלא מתאים לטקסטים ארוכים או מסמכים שלמים בלי חלוקה מוקדמת לפסקאות. החיסרון הבולט ביותר מגיע דווקא מהיוצרים עצמם, שממליצים לעבור לסדרת v3 החדשה שלהם, שכוללת חלון הקשר של 8192 טוקנים וציונים גבוהים יותר.

שאלות
נפוצות

האם כדאי לבחור בו לפרויקט חדש?

עדיף לבדוק קודם את סדרת v3 של אותם מפתחים. היוצרים בעצמם ממליצים על גרסאות v3 החדשות יותר, שמגיעות עם חלון הקשר גדול בהרבה של 8192 טוקנים וביצועים מעט יותר טובים.

האם המודל יודע להתמודד עם מסמכים ארוכים?

לא. חלון ההקשר שלו מוגבל ל־512 טוקנים בלבד. אם יש לכם טקסטים ארוכים, תצטרכו לחתוך אותם לפסקאות קצרות לפני יצירת הווקטורים.

איך מריצים

ההרצה פשוטה מאוד ומתבצעת דרך ספריית sentence-transformers, לצד חבילות ספציפיות ליפנית כמו fugashi, sentencepiece ו־unidic-lite לטוקניזציה. קבצי המודל שוקלים 644 מגה-בייט בלבד, ובדיוק bfloat16 הוא צורך מעט מאוד זיכרון, כך שכרטיס מסך בסיסי או מעבד מודרני בשרת ענן זול יספיקו בהחלט.

אם אתם לא רוצים לנהל סביבת פייתון ייעודית עם תלויות טוקניזציה מורכבות ליפנית, עדיף להשתמש ב־API מנוהל חיצוני. עם זאת, בזכות המשקל הקל, הרצה מקומית תחסוך עלויות שוטפות משמעותיות בלי צורך בחומרה יקרה.

pip install -U huggingface_hub
hf download cl-nagoya/ruri-large

הקבצים

45 קבצים במאגר, 644 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון אפאצ'י 2.0 מתיר שימוש מסחרי מלא, שינוי של המשקלים, שילוב בקוד סגור והפצה במוצר שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי, בלי חובת פתיחת קוד המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗