GPT
K

KoE5

קוד פתוח

nlpai-labmit2024-09-24

  • transformers
  • safetensors
  • xlm-roberta
  • feature-extraction
  • ko

מודל שיכוך טקסט לקוריאנית ואנגלית, שמבוסס על התאמה ייעודית של מודל רב לשוני קיים למשימות אחזור מידע מדויקות.

  • 560Mפרמטרים
  • 514טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 58,582הורדות בחודש

מה זה

מדובר במודל וקטורי בגודל 560 מיליון פרמטרים שנבנה על בסיס multilingual-e5-large ועבר אימון ייעודי על דאטה־סט קוריאני של מעל 700 אלף שלשות טקסט. הוא מייצר וקטורים באורך 1024 ממדים ומיועד בעיקר לחיפוש סמנטי והתאמת שאלות לתשובות בקוריאנית ובאנגלית.

במבחני ביצועים מול מודלים אחרים בגודל דומה הוא מציג דיוק סביר עם ציון Recall של 0.501 בבחירה הראשונה, אבל נשאר כמעט זהה למודל המקורי שעליו הוא מתבסס. באותם מבחנים, גרסאות חזקות יותר כמו KURE-v1 או BGE-m3 מובילות עליו בפער ניכר בכל מדדי האחזור, כך שההתאמה כאן נותנת יתרון קטן מאוד אם בכלל.

מתאים ל

  • חיפוש סמנטי בקוריאנית

    שליפת פסקאות רלוונטיות לפי שאלת משתמש, בתנאי שהשאילתה והמסמכים קצרים יחסית.

  • מערכות RAG ממוקדות

    שלב ראשון של איתור קטעי מידע מתוך מאגר מסמכים קוריאני עבור מודל שפה.

  • סיווג וקיבוץ טקסטים

    יצירת ייצוגים וקטוריים של פסקאות כדי לבצע אשכולות וזיהוי נושאים.

איפה זה נופל

חלון ההקשר מוגבל ל־514 טוקנים בלבד, וטקסטים ארוכים מזה נחתכים מיד. המודל לא מתאים למסמכים מלאים אלא לפסקאות קצרות. בנוסף, חובה להוסיף תחיליות ספציפיות כמו query או passage לכל קלט, אחרת איכות האחזור צונחת, ואין לו תמיכה מובנית בעברית.

שאלות
נפוצות

חייבים להוסיף קידומת לפני כל טקסט שמכניסים אליו?

כן, המודל אומן לצפות למילים query או passage בתחילת המשפט. בלי הקידומות האלה המודל מזהה את מבנה הטקסט בצורה שגויה, ואיכות החיפוש והדימיון הסמנטי יורדת באופן משמעותי.

הוא מתאים לאחזור של מסמכים ארוכים שלמים?

לא, הוא מוגבל ל־514 טוקנים וכל מה שמעבר נחתך. אם המטרה היא לקרוא עמודים שלמים בקוריאנית, עדיף לחתוך את המידע לפסקאות קצרות מראש או להשתמש בגרסה הארוכה שלהם, KURE-v1, שתומכת בעד 8192 טוקנים.

איך מריצים

טוענים את המשקלים ישירות דרך ספריית sentence-transformers בפייתון ומריצים חישוב וקטורים. הקבצים שוקלים 2.1 גיגה־בייט בדיוק רגיל, כך שכל כרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון יריץ אותו בקלות גם באצוות בינוניות.

אם כל מה שאתם צריכים זה לחפש במסמכים קצרים בקוריאנית, להרים אותו עצמאית בשרת זול יחסוך עלויות API חיצוניות. מצד שני, אם אתם מחפשים ביצועי קצה, המפתחים עצמם מציעים גרסה רחבה יותר באותו מאגר בשם KURE-v1 שמגיעה לתוצאות טובות בהרבה.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="nlpai-lab/KoE5")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש בו בפרויקטים מסחריים, לשנות אותו, להריץ אותו בענן פרטי או להפיץ אותו כחלק ממוצר בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗