GPT
K

KR-SBERT-V40K-klueNLI-augSTS

קוד פתוח

snunlpרישיון לא דווח2022-05-03

  • sentence-transformers
  • pytorch
  • bert
  • feature-extraction
  • sentence-similarity

מודל שיעבוד קוריאנית לקטורים צפופים של 768 ממדים. מי שבונה חיפוש סמנטי או קלסטרינג לטקסטים בקוריאנית ימצא כאן כלי ממוקד שעבר אימון ייעודי.

  • 512טוקנים בהקשר
  • 447 MBמשקל הקבצים
  • 204,471הורדות בחודש
  • 84לייקים

מה זה

מדובר במודל המבוסס על ארכיטקטורת ברט עם 12 שכבות, שנועד לייצר וקטורים של משפטים ופסקאות בקוריאנית. המודל ממפה כל טקסט למרחב וקטורי של 768 ממדים באמצעות פעולת מיצוע טוקנים, מה שמאפשר להשוות מרחקים ודמיון בין משפטים שונים בשפה הזו בקלות ובמהירות.

ההבדל המרכזי שלו מגרסאות קודמות בסדרה הוא האימון על שילוב של מערכי הנתונים klueNLI ו־augSTS. במבחן של סיווג מסמכים שמופיע בתיעוד, הוא הגיע לדיוק של 0.8628, לעומת 0.8400 בגרסאות הסטנדרטיות ו־0.8511 בגרסה עם אוגמנטציה בלבד. זה מראה שהמידע הנוסף מהנתונים הללו אכן שיפר את היכולת שלו להבדיל בין קטגוריות טקסט שונות בקוריאנית בצורה עקבית.

בסך הכל הוא בנוי למשימות דמיון סמנטי, קיבוץ וסיווג, בלי לנסות להיות מודל שפה גנרטיבי. אם אתם עובדים עם קוריאנית, השילוב של אוצר מילים ייעודי והתאמה למשפטים נותן לו יתרון על פני מודלים רב-לשוניים כלליים.

מתאים ל

  • חיפוש סמנטי בקוריאנית

    מייצר וקטורים איכותיים למשפטים קצרים בקוריאנית שמאפשרים לשלוף תוצאות לפי משמעות ולא לפי מילות מפתח.

  • סיווג מסמכים וטקסטים

    הציג דיוק של 0.8628 במבחן סיווג, ומספק ייצוג וקטורי יעיל להזנה לתוך מסווגים מהירים.

  • חלוקה לאשכולות

    וקטורים בגודל 768 ממדים מאפשרים לקבץ פניות לקוחות או קטעי חדשות בקוריאנית לקבוצות נושאים דומות.

איפה זה נופל

הבעיה הבולטת ביותר היא אורך הטקסט. למרות שחלון ההקשר הכללי של ברט מוגדר על 512, שכבת הטרנספורמר בכרטיס המודל מוגדרת עם אורך רצף מרבי של 128 טוקנים בלבד. טקסט ארוך יותר פשוט ייחתך, ולכן הוא לא מתאים למסמכים ארוכים בלי פירוק מוקדם לפסקאות קצרות.

בנוסף, המודל אומן ספציפית על קוריאנית. אם תנסו להכניס לו טקסטים בעברית או באנגלית, תקבלו ייצוגים חסרי משמעות. שווה גם לשים לב שתוצאת הדיוק שפורסמה מתייחסת למערך בדיקה ספציפי של סיווג, ולא בהכרח מייצגת כל משימת חיפוש.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית או באנגלית?

לא, הוא מיועד ומאומן ספציפית עבור קוריאנית. הרצה של עברית תפיק וקטורים אקראיים שלא יעזרו לכם במשימות דמיון סמנטי.

כמה טקסט אפשר להכניס לו בכל פעם?

ההגדרה במודל מגבילה את האורך ל־128 טוקנים בלבד. כל משפט או קטע שארוך מזה ייחתך בסוף, כך שהוא מתאים לפסקאות קצרות בלבד.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בשתי שורות קוד, או שעובדים איתו ידנית דרך הספרייה הבסיסית של האגינג פייס ומפעילים שכבת מיצוע על הפלט. משקל הקבצים עומד על 447 מגה-בייט בסך הכל, כך שלא צריך שרתים כבדים. כל מחשב פיתוח ממוצע עם מעבד סביר יכול להריץ אותו בלי להזיע.

אין כאן צורך בכרטיס מסך ייעודי אם אתם מעבדים נפחים קטנים, ומעבד גרפי פשוט יספיק לדחיפת אלפי משפטים בדקה. בגלל המשקל הקטן וההפעלה המקומית הפשוטה, אין שום סיבה לשלם על שירות ענן חיצוני או שירותי צד שלישי כדי לקבל וקטורים מהמודל הזה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("snunlp/KR-SBERT-V40K-klueNLI-augSTS")
v = m.encode(["שלום עולם"])

הרישיון

היוצרים לא דיווחו על רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון מפורש אומר שאין לכם היתר ברור להשתמש בקוד ובמשקלים במוצר מסחרי, וזה יוצר סיכון משפטי ברור. מי שמתכנן להפיץ את זה במוצר שלו צריך לפנות ישירות לצוות של snunlp ולבקש הבהרה.

הרישיון המלא בעמוד המודל ↗