GPT
T

text2vec-base-chinese-paraphrase

קוד פתוח

shibing624apache-2.02023-06-19

  • sentence-transformers
  • pytorch
  • safetensors
  • ernie
  • feature-extraction

מודל וקטורי ייעודי לסינית שממיר משפטים ופסקאות קצרות לווקטור של 768 ממדים. הוא מתאים למי שצריך חיפוש סמנטי או התאמת ניסוחים בסינית ומחפש מודל קל משקל שרץ מקומית.

  • 118Mפרמטרים
  • 2,048טוקנים בהקשר
  • 901 MBמשקל הקבצים
  • 184,802הורדות בחודש

מה זה

מדובר במודל הטמעה שנבנה על בסיס ernie-3.0-base-zh ואומן בשיטת CoSENT. המטרה שלו היא לייצר ייצוגים וקטוריים של טקסטים בסינית, עם דגש על התאמה בין משפט לפסקה, מה שנקרא sentence to paraphrase, ולא רק השוואה בין משפטים בודדים.

בטבלת ההשוואה שפרסם היוצר, המודל השיג ציון Spearman ממוצע של 63.08 על פני שבעה מבחני ביצועים שונים, הציון הגבוה ביותר מבין החלופות שנבדקו שם, כולל גרסאות מבוססות RoBERTa ודגמים רב לשוניים. זה אומר שבמשימות הבנה של כוונת המשפט בסינית הוא מדרג דמיון בצורה מדויקת יותר מהחלופות בגודל דומה, תוך שמירה על קצב של 3,066 שאילתות בשנייה בבדיקות המחבר.

מתאים ל

  • חיפוש סמנטי בסינית

    התאמת שאילתות קצרות לפסקאות מידע במאגר תוכן סיני בדיוק גבוה.

  • זיהוי כוונות בצ'אטבוט

    מיפוי ניסוחים שונים של משתמשים לשאלות נפוצות מוגדרות מראש.

  • הסרת כפילויות בטקסט

    איתור משפטים בעלי משמעות זהה בניסוח שונה כדי לנקות דאטה-סטים בסינית.

איפה זה נופל

למרות שחלון ההקשר הטכני מוגדר לעד 2,048 טוקנים, המודל אומן עם מגבלת אורך של 256 טוקנים בלבד, וכל טקסט מעבר לזה נחתך אוטומטית. מי שבונה על חיפוש במסמכים שלמים יקבל חיתוך אגרסיבי. בנוסף, המודל מאומן לחלוטין על סינית, והוא חסר תועלת בעברית או באנגלית.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית או באנגלית?

לא. המודל מאומן ומכויל ספציפית לשפה הסינית בלבד. אם יש לכם מערכת שדורשת תמיכה בריבוי שפות או בעברית, הוא יחזיר תוצאות לא רלוונטיות ועדיף לבחור מודל רב לשוני ייעודי.

האם כדאי להשתמש בו לחיפוש בתוך מסמכים ארוכים?

לא מומלץ בלי חלוקה מוקדמת לפסקאות. ברירת המחדל חותכת כל קלט מעבר ל־256 טוקנים, כך שכל מידע שנמצא מעבר לתחילת הטקסט פשוט יילך לאיבוד.

איך מריצים

המשקל הכולל של הקבצים עומד על 901 מגה בייט, ועם 118 מיליון פרמטרים ב־float32 אין שום צורך בחומרה כבדה. מעבד מודרני ממוצע בשרת יריץ אותו בלי להזיע, וכרטיס מסך בסיסי יספיק לעיבוד מהיר במיוחד. אפשר לטעון אותו ישירות דרך ספריית sentence-transformers או בחבילת text2vec הייעודית.

אם כל מה שאתם צריכים זה חיפוש מקומי במאגר נתונים קטן או בינוני בסינית, אין טעם לשלם על API חיצוני. הרצה עצמית כאן זולה, פשוטה, ולא מייצרת תלות ברשת.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("shibing624/text2vec-base-chinese-paraphrase")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא apache-2.0, מה שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצר, ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗