GPT
K

kobart-base-v2

קוד פתוח

gogamzamit2022-03-02

  • transformers
  • pytorch
  • safetensors
  • bart
  • feature-extraction

המודל מציע ארכיטקטורת קידוד ופענוח ייעודית לקוריאנית בגודל קומפקטי. הוא מתאים למי שבונה חילוץ מאפיינים או משימות שפה מקומיות ולא רוצה להחזיק מפלצות ענק.

  • 124Mפרמטרים
  • 1,026טוקנים בהקשר
  • 946 MBמשקל הקבצים
  • 3,121הורדות בחודש

מה זה

מדובר במודל שפה מסוג BART שאומן על יותר מ־40 גיגה-בייט של טקסטים בקוריאנית, כולל ויקיפדיה מקומית, חדשות, ספרים ושיחות. המבנה שלו כולל שישה לוחות מקודד ושישה לוחות מפענח, עם מילון של 30,000 טוקנים שהורחב ידנית כדי לזהות רצפי אימוג'ים וסמיילים נפוצים בהתכתבויות.

במבחני הביצועים הוא מציג דיוק של 90.24 אחוזים בסיווג רגשות על מאגר NSMC, ציון של 81.66 במתאם ספירמן על KorSTS לדמיון בין משפטים, ודיוק של 94.34 אחוזים בזיהוי צמדי שאלות זהות. המספרים האלה מראים שהוא מחזיק הבנה תחבירית וסמנטית טובה מאוד בטקסטים קוריאניים קצרים, במיוחד כשמשווים את זה למשקל הקל שלו.

מתאים ל

  • חילוץ וקטורים בקוריאנית

    יצירת ייצוגים וקטוריים מדויקים לטקסט קוריאני עבור מנועי חיפוש וסיווג.

  • זיהוי כוונות בצ'אטים

    המילון כולל אמוג'ים מובנים שמאפשרים לפענח סלנג והבעות פנים בהודעות רשת.

  • בדיקת כפילות שאלות

    הוא מציג מעל 94 אחוזי דיוק בזיהוי שאלות בעלות משמעות זהה בקוריאנית.

איפה זה נופל

הוא יודע קוריאנית בלבד. אין לו תמיכה בעברית או באנגלית מעבר לרמה מקרית, כך שאם הקלט משלב כמה שפות הוא יאבד כיוון מהר מאוד. בנוסף, חלון ההקשר מוגבל ל־1,026 טוקנים, מה שפוסל ניתוח של מסמכים ארוכים או חוזים בלי לחתוך אותם קודם.

הכרטיס מדגיש שהמידע אומן בין היתר על עצומות ושיחות רשת, ולכן הפלטים עלולים להכיל הטיות, סטריאוטיפים וביטויים בעייתיים כלפי קבוצות שונות. חייבים לבדוק ולסנן את התוצרים לפני שמחברים אותו לממשק חי.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא. המודל אומן ספציפית על מאגרי טקסט קוריאניים ואינו מיועד לעבודה עם עברית כלל. ניסיון להזין לו תווים בעברית יוביל לחיתוך לקוי של טוקנים ולתוצאות שגויות לחלוטין.

איזה סוג משאבים צריך כדי להריץ אותו בייצור?

המשקל של המודל הוא 946 מגה-בייט בלבד עם 124 מיליון פרמטרים. המשמעות היא שכל מכונה וירטואלית פשוטה בענן עם שני גיגה זיכרון פנוי ומעבד סטנדרטי יכולה לשרת בקשות בלי צורך במאיצי GPU יקרים.

איך מריצים

ההפעלה נעשית ישירות דרך ספריית transformers בפייתון עם PreTrainedTokenizerFast ו־BartModel. עם משקל קבצים של פחות מגיגה-בייט ו־124 מיליון פרמטרים, אפשר להריץ אותו בלי שום מאמץ על כל כרטיס מסך בסיסי, וגם על מעבד רגיל בשרת פשוט בלי לחנוק את הזיכרון.

בגודל הזה אין שום סיבה לשלם לספקי API חיצוניים על קריאות רשת. אתם טוענים אותו ישירות לתוך הזיכרון של התהליך שלכם, מקבלים זמני תגובה מהירים של לוקאל, ושומרים על המידע אצלכם בלי לגעת בתשתיות ענן יקרות.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="gogamza/kobart-base-v2")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר חופש כמעט מוחלט. מותר לשלב אותו במוצרים מסחריים, לשנות את המשקלים, להפיץ מחדש ולהריץ בכל תשתית, כל עוד משאירים את הצהרת זכויות היוצרים המקורית של המפתח בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗