GPT
S

sbert-base-chinese-nli

קוד פתוח

uerapache-2.02022-03-02

  • sentence-transformers
  • pytorch
  • bert
  • feature-extraction
  • sentence-similarity

מודל שיודע לחשב דמיון סמנטי בין משפטים בסינית, ומבוסס על Sentence-BERT. הוא שוקל מעט ומתאים למי שבונה חיפוש סמנטי פנימי בלי להסתמך על שירותי ענן.

  • 512טוקנים בהקשר
  • 390 MBמשקל הקבצים
  • 1,896הורדות בחודש
  • 138לייקים

מה זה

מדובר במודל וקטורי שמיועד לחלץ ייצוגים סמנטיים של משפטים בסינית לצורך השוואת דמיון, בדרך כלל בעזרת חישוב קוסינוס. הבסיס שלו הוא מודל RoBERTa סיני בעל 12 שכבות בשם chinese_roberta_L-12_H-768, שעבר אימון המשך על מאגר ChineseTextualInference בעזרת כלי הקוד הפתוח UER-py. הוא נוצר כדי להתמודד עם משימות של הסקת מסקנות טקסטואלית ולספק וקטור סמנטי מייצג לכל משפט, במקום להסתפק בהשוואת מילים פשוטה.

בכרטיס המודל אין מדדי ביצועים מספריים או מבחני השוואה חיצוניים, כך שאי אפשר לדעת מראש מה רמת הדיוק שלו מול חלופות מודרניות יותר באותה שפה. מה שכן ידוע הוא תהליך האימון: הוא רץ חמישה מחזורים עם אורך רצף של 128 טוקנים בלבד, ונשמר בנקודה שבה הציג את התוצאה הטובה ביותר על סט הפיתוח של המאגר. הוא ספציפי לגמרי לשפה הסינית ולא מתיימר לתמוך בשפות אחרות.

מתאים ל

  • חיפוש סמנטי בסינית

    שליפת פריטים דומים או שאלות נפוצות בסינית על בסיס משמעות המשפט ולא התאמת מילים מדויקת.

  • סינון כפילויות בטקסט

    זיהוי ואיחוד של משפטים בעלי משמעות זהה במאגרי מידע ובטקסטים קצרים בשפה הסינית.

  • מיון והסקת מסקנות

    חילוץ וקטורים לייצוג משפטים עבור מודלים נוספים של סיווג טקסט והסקת מסקנות בסינית.

איפה זה נופל

האימון בפועל הוגבל לאורך של 128 טוקנים בלבד, למרות שארכיטקטורת המודל תומכת טכנית בעד 512 טוקנים. זה אומר שאם תזינו פסקאות ארוכות, איכות הייצוג עלולה לרדת משמעותית מעבר למשפטים קצרים. בנוסף, המודל אומן אך ורק על סינית, כך שהוא חסר תועלת לחלוטין לטקסטים בעברית, אנגלית או שפות מעורבות. כדאי לבדוק אותו על הנתונים שלכם לפני שילוב במערכת, כי היוצרים לא פרסמו תוצאות מדידה מסודרות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

לא. המודל אומן על נתונים בשפה הסינית בלבד עם אוצר מילים ייעודי לסינית. טקסטים בעברית או באנגלית פשוט לא יעבדו.

האם חייבים כרטיס מסך כדי להריץ אותו במוצר?

לא חובה. גודל הקבצים הוא 390 מגה בייט בלבד, ולכן אפשר להריץ אותו בקלות על מעבד רגיל של שרת קיים בלי עלויות חומרה מיוחדות.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בשורה או שתיים של קוד פייתון, ומריצים עליו טקסטים לקבלת וקטורים. משקל הקבצים הכולל עומד על 390 מגה בייט, כך שלא צריך מעבד גרפי כבד כדי לעבוד איתו. כל שרת בסיסי או אפילו מחשב פיתוח רגיל יריצו אותו על מעבד מרכזי בלי שום בעיה ובזמני תגובה מהירים.

אם כל מה שאתם צריכים זה לחשב דמיון עבור כמה אלפי משפטים בסינית, אין שום סיבה להשתמש ב־API חיצוני בתשלום. הריצה המקומית פשוטה מאוד ולא דורשת תחזוקה של תשתית מורכבת.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("uer/sbert-base-chinese-nli")
v = m.encode(["שלום עולם"])

הקבצים

7 קבצים במאגר, 390 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובה לחשוף את הקוד של המוצר שבו תשלבו אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗