GPT
V

vietnamese-sbert

קוד פתוח

keepitrealרישיון לא דווח2022-03-02

  • sentence-transformers
  • pytorch
  • roberta
  • feature-extraction
  • sentence-similarity

מודל שיודע לייצר וקטורים למשפטים בווייטנאמית לצורכי חיפוש סמנטי והשוואת טקסטים. אם הדאטה שלכם לא כולל וייטנאמית, אין לכם מה לחפש פה.

  • 258טוקנים בהקשר
  • 517 MBמשקל הקבצים
  • 46,479הורדות בחודש
  • 54לייקים

מה זה

מדובר בהתאמה של ארכיטקטורת RobertaModel עם 12 שכבות שממירה משפטים ופסקאות למרחב וקטורי של 768 ממדים. המטרה שלו ממוקדת לחלוטין בוייטנאמית, והוא מיועד למשימות כמו חלוקה לאשכולות, בדיקת דמיון בין משפטים ומנועי חיפוש פנימיים שצריכים להבין את המשמעות של השפה הזו.

הוא אומן במשך 4 תקופות אימון עם פונקציית הפסד של CosineSimilarityLoss ומשתמש במיצוע טוקנים מעל השכבה האחרונה. כרטיס המודל לא חושף נתוני מדידה עצמאיים או השוואה מול גרסאות אחרות, ומפנה לבנצ'מרק כללי בלי לספק מספרים ספציפיים על הדיוק שלו.

מתאים ל

  • חיפוש סמנטי בוייטנאמית

    ממיר שאילתות ומשפטים לווקטור של 768 ממדים שמאפשר לאתר תוכן לפי כוונה ולא רק לפי מילים מדויקות.

  • אשכול טקסטים קצרים

    מתאים לקיבוץ פניות משתמשים, כותרות או ביקורות קצרות בווייטנאמית לקבוצות נושאים דומות.

  • זיהוי כפילויות תוכן

    מאפשר להשוות מרחק קוסינוס בין שני משפטים כדי לראות אם הם מביעים את אותו רעיון בניסוח שונה.

איפה זה נופל

המגבלה הכי בולטת היא אורך הקלט, שנחתך סביב 256 עד 258 טוקנים. מסמכים ארוכים, כתבות מלאות או חוזים פשוט יאבדו מידע אם לא תפרקו אותם מראש למשפטים קצרים.

מעבר לזה, המודל אומן על וייטנאמית בלבד. אין לו יכולת להתמודד עם עברית או אנגלית כבסיס להשוואה, והיוצר שלו לא צירף מידע על הדאטה שעליו הוא אומן או תוצאות בדיקה רשמיות.

שאלות
נפוצות

האם המודל יודע להתמודד עם טקסטים בעברית?

לא. הארכיטקטורה והאימון שלו מיועדים ספציפית לווייטנאמית. קלטים בעברית לא ייצרו ייצוג סמנטי מועיל, ובשביל זה תצטרכו מודלים רב-לשוניים ייעודיים.

אפשר להזין לו מסמכים שלמים בבת אחת?

לא מומלץ. חלון ההקשר שלו מוגבל ל־256 טוקנים בלבד, כך שכל תוכן שמעבר לכך ייחתך. עדיף לחלק את הטקסט לפסקאות קצרות או למשפטים בודדים לפני ההמרה לווקטורים.

איך מריצים

המשקל הכולל של הקבצים עומד על 517 מגה בייט בדיוק float32. זה גודל קומפקטי מאוד שאפשר להריץ בלי בעיה על מעבד רגיל בכל שרת פשוט, בלי להזדקק לכרטיס מסך ייעודי, באמצעות ספריית sentence-transformers הרגילה בפייתון.

בגלל שמדובר במודל קטן ומקומי, אין שום סיבה אמיתית לחפש לו שירות ענן חיצוני או לשלם על קריאות API. הוא רץ ישירות בקוד שלכם בכמה שורות, כל עוד יש לכם חצי ג'יגה פנוי בזיכרון.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("keepitreal/vietnamese-sbert")
v = m.encode(["שלום עולם"])

הרישיון

היוצר לא דיווח על רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין אישור מפורש להשתמש בו במוצר מסחרי או להפיץ אותו מחדש. אם אתם בונים מערכת לחברה או ללקוח, זו נקודה בעייתית שדורשת פנייה ישירה למפתח לפני שנוגעים בקוד.

הרישיון המלא בעמוד המודל ↗