GPT
V

vietnamese-bi-encoder

קוד פתוח

bkai-foundation-modelsapache-2.02023-09-09

  • generic
  • pytorch
  • safetensors
  • roberta
  • feature-extraction

מודל שיודע לייצר וקטורים מדויקים לטקסטים בוייטנאמית לצורכי חיפוש סמנטי. הוא מתאים למי שבונה מערכת חיפוש או RAG ייעודית לשפה הזו.

  • 135Mפרמטרים
  • 258טוקנים בהקשר
  • 1.0 GBמשקל הקבצים
  • 454,467הורדות בחודש

מה זה

מדובר במודל bi-encoder מבוסס PhoBERT-base-v2 עם 135 מיליון פרמטרים, שממיר משפטים ופסקאות בוייטנאמית לווקטורים צפופים בגודל 768 ממדים. הוא אומן על שילוב של תרגומים לוייטנאמית של MS MARCO ו־SQuAD v2, יחד עם שמונים אחוז מנתוני אתגר אחזור הטקסט המשפטי Zalo 2021.

בבדיקה מול המתחרים על עשרים האחוזים הנותרים של מאגר Zalo, הוא מציג זינוק רציני. ציון ה־MRR@10 שלו מגיע ל־80.73 לעומת 45.3 של Vietnamese-SBERT הישן יותר ו־58.37 של מודל שאומן רק על MS MARCO. המשמעות היא שבשמונים אחוז מהמקרים, התוצאה הנכונה מדורגת ממש בראש הרשימה, מה שהופך אותו לפתרון חזק מאוד לאחזור מסמכים מורכבים בשפה הזו.

מתאים ל

  • חיפוש סמנטי בוייטנאמית

    הוא ממיר שאילתות ומסמכים בוייטנאמית לוקטורים לצורך שליפה מדויקת ומדורגת.

  • מנוע אחזור ל־RAG

    התוצאות הגבוהות ב־MRR הופכות אותו לבסיס מתאים לשליפת פסקאות עבור מודל שפה.

  • אשכול טקסטים ומיון

    הייצוג הוקטורי שלו ב־768 ממדים מתאים לקיבוץ נושאים וחלוקה לקטגוריות.

איפה זה נופל

הבעיה המרכזית שלו היא חלון הקשר קצר של 258 טוקנים בלבד, כך שהוא פשוט יחתוך טקסטים ארוכים, חוזים ומאמרים אם לא תפרקו אותם מראש לפסקאות קצרות. בנוסף, חובה לבצע חלוקה למילים, word segmentation, לפני שמעבירים לו טקסט בספריית פייתון, אחרת הווקטורים יאבדו מהדיוק שלהם. מעבר לכך, הבדיקות והאימון שלו נשענו על טקסטים משפטיים ותרגומים, אז שווה לבדוק היטב איך הוא מתמודד עם סלנג או שיחות יומיומיות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לחיפוש בעברית או באנגלית?

לא. המודל הוגדר ואומן ספציפית עבור וייטנאמית על בסיס PhoBERT, ולכן הוא לא מתאים לעיבוד שפות אחרות.

למה הטקסט שלי מוחזר חלקי או לא מדויק בהרצה?

יש לו שתי מגבלות שחייבים לטפל בהן בקוד. צריך לחלק את המילים מראש בעזרת כלי ייעודי לוייטנאמית, ולוודא שהטקסט לא חורג מ־258 טוקנים כדי שלא ייחתך.

איך מריצים

המשקל הכולל של הקבצים הוא גיגה-בייט אחד בלבד, כך שתוכלו להריץ אותו בלי בעיה על מעבד רגיל, או על כל כרטיס מסך בסיסי עם זיכרון צנוע של שניים עד ארבעה גיגה. ההרצה נעשית דרך ספריית sentence-transformers הרגילה בפייתון בעזרת שורות קוד בודדות.

אין סיבה אמיתית לשלם על שירותי API חיצוניים כדי לייצר אמבדינגס במודל בגודל כזה. הוא קל משקל, התשובה חוזרת מהר מאוד, ושרת מקומי קטן יחזיק נפח עבודה גבוה ללא מאמץ.

pip install -U huggingface_hub
hf download bkai-foundation-models/vietnamese-bi-encoder

הרישיון

המודל שוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או מסחרית בתוך המוצר שלכם. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗