GPT
T

text2vec-base-chinese

קוד פתוח

shibing624apache-2.02022-03-02

  • sentence-transformers
  • pytorch
  • onnx
  • safetensors
  • openvino

מודל ותיק וממוקד לייצור וקטורים ממשפטים בסינית, עם מהירות עיבוד גבוהה ומשקל קל. מתאים למי שבונה חיפוש סמנטי בשפה הזו ומחפש פתרון פשוט להתקנה מקומית.

  • 102Mפרמטרים
  • 512טוקנים בהקשר
  • 1.8 GBמשקל הקבצים
  • 993,646הורדות בחודש

מה זה

הבסיס כאן הוא ארכיטקטורת ברט המבוססת על chinese-macbert-base, שעברה אימון בשיטת CoSENT להפקת וקטורים צפופים בגודל 768 ממדים. המטרה העיקרית שלו היא השוואה סמנטית בין משפטים ופסקאות קצרות בסינית, ולא יצירת טקסט.

במבחני התאמת טקסט, המודל מציג ציון ממוצע של 51.61 במדד ספירמן, עם מהירות של 3,008 שאילתות בשנייה. הוא עוקף בקלות מודלים ישנים של וורד-טו-וק או חלופות רב-לשוניות גנריות כמו מיני-אל-אם במבחנים המקומיים, אבל מפסיד בבירור לגרסאות מתקדמות יותר של אותו יוצר שנשענות על ארני ומגיעות לציונים של מעל 63. מדובר בסוס עבודה יציב ומהיר שמספק תוצאות סבירות, אך רחוק מלהיות המוביל בדיוק.

מתאים ל

  • חיפוש סמנטי בשאילתות בסינית

    התאמה מהירה של שאלות משתמש למאגר תשובות קיים, עם קצב של אלפי בקשות בשנייה.

  • קבוץ משפטים למניעת כפילויות

    זיהוי משפטים דומים בתוכן בתוך מאגרי טקסט גדולים בסינית בעלות חישובית נמוכה.

  • מנוע אחזור למערכות שרת מקומי

    מתאים לשרתים ללא כרטיס מסך חזק בזכות תמיכה בהאצת מעבד של אופנווינו.

איפה זה נופל

הבעיה המרכזית היא חלון הקלט. ברירת המחדל חותכת כל מה שמעבר ל־256 תת-מילים, והארכיטקטורה עצמה מוגבלת לתקרה של 512 טוקנים, כך שהוא לא מתאים למסמכים ארוכים אלא למשפטים קצרים בלבד. בנוסף, הוא אומן על סינית בלבד, כך שטקסט בעברית או באנגלית לא יקבל ייצוג שימושי.

מבחני הביצועים חושפים חולשה משמעותית במשימות מסוימות. במבחן PAWSX המודל מקבל ציון נמוך מאוד של 17.21, לעומת מעל 40 בגרסאות המקבילות מבוססות ארני, מה שאומר שהוא מתקשה מאוד לזהות התאמות מורכבות או ניסוחים דומים שמשנים משמעות.

שאלות
נפוצות

האם כדאי להשתמש במודל הזה עבור טקסט מעורב של סינית ואנגלית?

לא. המודל אומן על נתונים בסינית בלבד ומבוסס על מודל שפה סיני. למשימות שכוללות כמה שפות עדיף לבחור גרסאות רב-לשוניות ייעודיות.

האם המודל הזה מתאים לעיבוד של מסמכים שלמים?

הוא לא בנוי לזה. ברירת המחדל חותכת טקסטים מעל 256 תת-מילים והאימון שלו התמקד בהתאמת משפטים בודדים, כך שעבור פסקאות ארוכות תקבלו וקטורים פחות מדויקים.

איזו גרסה שלו כדאי להוריד לייצור?

אם יש לכם כרטיס מסך, קובץ האונקס ברמת אופטימיזציה 4 ייתן מהירות כפולה באותו דיוק. לריצה על גבי מעבד בלבד, גרסת הקוונטיזציה של 8 ביט תספק ביצועים מהירים משמעותית עם ירידה מזערית באיכות.

איך מריצים

כדי להריץ אותו צריך רק פייתון ואת הספרייה sentence-transformers או ספריית text2vec של היוצר. הקבצים שוקלים 1.8 גיגה-בייט והמודל כולל 102 מיליון פרמטרים, מה שאומר שהוא ירוץ בלי שום בעיה על כרטיס מסך ביתי פשוט, וגם על מעבד רגיל של שרת מקומי.

יש גרסאות מותאמות שמאיצות את העסק: הרצה באמצעות אופנווינו נותנת פי 4.78 בביצועים על מעבד עם קוונטיזציה של 8 ביט, והרצה בפורמט אונקס ברמת אופטימיזציה 4 מכפילה את המהירות על גבי כרטיס מסך כמעט בלי פגיעה בדיוק. בגלל המשקל הנמוך והמהירות הזו, אין שום סיבה אמיתית לשלם על שירותי ענן חיצוניים אלא אם אתם מתעקשים להימנע מתחזוקת שרת עצמאי.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("shibing624/text2vec-base-chinese")
v = m.encode(["שלום עולם"])

הרישיון

הקוד והמשקלים מופצים תחת רישיון אפאצ'י 2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המערכת בתוך מוצר סגור. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗