GPT
K

ko-sroberta-multitask

קוד פתוח

jhganרישיון לא דווח2022-03-02

  • sentence-transformers
  • pytorch
  • tf
  • onnx
  • safetensors

מודל שיבוץ משפטים מבוסס רוברטה שנבנה במיוחד עבור קוריאנית. הוא מתאים למי שבונה חיפוש סמנטי או קלאסטרינג של טקסטים בשפה הזו ומחפש מודל קל משקל.

  • 111Mפרמטרים
  • 514טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 687,720הורדות בחודש

מה זה

מדובר במודל שממיר טקסט קוריאני לווקטורים צפופים באורך 768 ממדים, ומבוסס על ארכיטקטורת רוברטה עם 111 מיליון פרמטרים ו־12 שכבות. הוא אומן בריבוי משימות על מאגרי הנתונים KorNLI ו־KorSTS, שנועדו להבנת שפה טבעית בקוריאנית, באמצעות פונקציות מחיר של דירוג שליליות ודמיון קוסינוס.

במבחני KorSTS הוא מציג מתאם ספירמן של 85.60 ומתאם פירסון של 84.77 במרחב קוסינוס. המספרים האלה מראים שהוא יודע לזהות היטב קרבה סמנטית בין משפטים שונים בקוריאנית, ולא רק התאמת מילים יבשה, מה שהופך אותו לרלוונטי למיון טקסטים ולהשוואת משפטים ברמת דיוק סבירה למדי לגודלו.

מתאים ל

  • חיפוש סמנטי בקוריאנית

    הוא מאתר משפטים קרובים במשמעותם בקוריאנית באמצעות וקטורים של 768 ממדים.

  • קלאסטרינג של משפטים קצרים

    הוא קובץ טקסטים קוריאניים לקבוצות נושאיות על בסיס דמיון סמנטי שנמדד במרחב קוסינוס.

  • זיהוי כפילויות תוכן

    הוא משווה בין זוגות משפטים בקוריאנית כדי לזהות ניסוחים שונים עם אותה משמעות.

איפה זה נופל

הוא מוגבל אך ורק לשפה הקוריאנית. אם תנסו להעביר לו עברית, אנגלית או שילוב של שפות, תקבלו תוצאות חסרות משמעות. מעבר לזה, למרות שחלון ההקשר מוגדר טכנית ל־514 טוקנים, שכבת הטרנספורמר הוגדרה בזמן האימון לאורך מקסימלי של 128 טוקנים בלבד. טקסטים ארוכים או פסקאות מורכבות פשוט ייחתכו בהתחלה.

שאלות
נפוצות

האם המודל תומך בעברית או באנגלית?

לא. המודל אומן ספציפית על קוריאנית באמצעות קורפוסים מקומיים בלבד. שימוש בכל שפה אחרת לא יניב תוצאות שימושיות.

איך משפיעה מגבלת האורך של 128 טוקנים?

המודל מתאים למשפטים קצרים ולא למסמכים שלמים. טקסט שיעבור את 128 הטוקנים ייחתך על ידי הטרנספורמר, והווקטור שייווצר יתעלם מכל מה שנכתב אחרי החיתוך.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers עם קריאה פשוטה לשם המודל, או ישירות דרך transformers של HuggingFace בשילוב שכבת pooling ממוצעת. הקבצים שוקלים 2.4 גיגה בייט בדיוק של float32, כך שכל מעבד מודרני ממוצע יכול להריץ אותו בלי לחכות לכרטיס מסך ייעודי.

אם אתם צריכים לאנדקס כמויות אדירות של משפטים בזמן קצר, כרטיס מסך בסיסי יאיץ את העסק משמעותית. אם אתם צריכים רק שאילתות בודדות פה ושם, שרת פשוט ללא מאיץ גרפי יעשה את העבודה, ואין סיבה אמיתית לפנות לשירות ענן חיצוני.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("jhgan/ko-sroberta-multitask")
v = m.encode(["שלום עולם"])

הרישיון

היוצר לא דיווח על רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו במוצר מסחרי, ומוטב לבדוק את מקורות הדאטהסטים KorNLI ו־KorSTS לפני שמשלבים אותו במערכת פעילה.

הרישיון המלא בעמוד המודל ↗