GPT
T

text2vec-large-chinese

קוד פתוח

GanymedeNilapache-2.02023-03-07

  • transformers
  • pytorch
  • safetensors
  • bert
  • feature-extraction

הטמעה וקטורית לטקסט בסינית שמבוססת על LERT במקום MacBERT. אם אתם בונים חיפוש סמנטי למסמכים בסינית ורוצים מודל מקומי ממוקד, בשביל זה בנו אותו.

  • 326Mפרמטרים
  • 512טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 3,142הורדות בחודש

מה זה

מדובר במודל שנועד למשימות דמיון בין משפטים בסינית, שמחליף את עמוד השדרה של מודל הבסיס של shibing624 בארכיטקטורת LERT עם עשרים וארבע שכבות. המטרה של המהלך הזה היא לשפר את הדיוק של ייצוג הטקסט בלי לשנות את שאר תנאי האימון שהיו במקור.

הוא מפיק וקטורים שמייצגים משמעות של משפטים ופסקאות קצרות, מה שעוזר במערכות חיפוש סמנטי, סינון כפילויות או סיווג טקסטים. ההבדל המרכזי מול גרסאות קטנות יותר הוא המשקל של שלוש מאות עשרים ושישה מיליון פרמטרים, שנותן לו יכולת טובה יותר לקלוט דקויות בשפה, אבל דורש יותר משאבים בזמן ריצה.

מתאים ל

  • חיפוש סמנטי בסינית

    ממיר שאילתות ומסמכים לווקטורים כדי למצוא התאמות לפי משמעות ולא לפי מילות מפתח יבשות.

  • זיהוי כפילויות בטקסט

    מחשב מרחק בין משפטים שונים בסינית כדי לאתר תוכן זהה שנכתב בניסוח אחר.

  • שליפה לתוך מודלי שפה

    משמש שלב ראשון במערכות RAG שצריכות למצוא פסקאות רלוונטיות מתוך מאגר מידע בסינית.

איפה זה נופל

הוא מוגבל לחלון הקשר של 512 טוקנים, כך שאי אפשר לזרוק לתוכו מסמכים ארוכים בבת אחת בלי לחתוך אותם קודם. בנוסף, הוא אומן על סינית בלבד. אם תנסו להריץ עליו טקסט מעורב עם עברית או אנגלית, תקבלו תוצאות עקומות או חסרות משמעות לחלוטין. הכרטיס שלו דל מאוד בפרטים על מערכי הנתונים ששימשו לאימון, ולכן חובה לבדוק אותו על הדאטה הספציפי שלכם לפני שסומכים עליו בפרודקשן.

שאלות
נפוצות

האם המודל הזה מתאים לטקסטים בעברית או באנגלית?

לא. המודל אומן ספציפית על השפה הסינית. הרצה של שפות אחרות תייצר וקטורים לא מדויקים שלא מייצגים נכון את משמעות המשפטים.

האם חייבים כרטיס מסך כדי להשתמש בו בשרת?

לא חובה. הוא שוקל 2.4 ג'יגה בייט וקיימת גם גרסת onnxruntime שרצה מצוין על מעבד רגיל, אם כי לעומסי עבודה כבדים מאיץ גרפי יעבוד מהר בהרבה.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בתוך פייתון. קבצי המודל שוקלים 2.4 ג'יגה בייט בדיוק מלא, כך שכרטיס מסך בסיסי עם 4 או 6 ג'יגה זיכרון יריץ אותו בקלות. קיים גם פורמט מומר ל־onnxruntime שפורסם מאוחר יותר, ומתאים למי שרוצה להריץ אותו ישירות על מעבד בלי פייתון כבד.

אם אתם צריכים רק לבדוק שאילתות בודדות פעם ביום, הרמה של שרת ייעודי מיותרת. לעומת זאת, אם אתם מחשבים וקטורים למיליוני שורות של תוכן מקומי, שרת קטן עם מעבד גרפי יחסוך עלויות של קריאות רשת ויעבוד מהר יותר.

from transformers import pipeline

pipe = pipeline("sentence-similarity", model="GanymedeNil/text2vec-large-chinese")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי, כולל שילוב במוצרים מסחריים ושינוי של הקוד או המשקלים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם. אין חובה לפתוח את הקוד של המוצר שבו תטמיעו אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗