GPT
V

Vietnamese_Embedding

קוד פתוח

AITeamVNapache-2.02025-03-17

  • sentence-transformers
  • onnx
  • safetensors
  • xlm-roberta
  • Embedding

מודל שיעבוד מעולה אם יש לכם צורך בחיפוש סמנטי או אחזור מידע שמתמקד כולו בטקסטים בווייטנאמית. הוא מתבסס על BGE-M3 ועבר התאמה ממוקדת לשפה הזו בדיוק.

  • 568Mפרמטרים
  • 8,194טוקנים בהקשר
  • 4.3 GBמשקל הקבצים
  • 59,060הורדות בחודש

מה זה

מדובר במודל וקטורי של 568 מיליון פרמטרים שמחזיר וקטורים בגודל 1024 ממדים, ומבוסס על הארכיטקטורה של XLM-RoBERTa. הצוות לקח את BGE-M3 ואימן אותו מחדש על כ־300 אלף שלשות של שאילתה, מסמך חיובי ומסמך שלילי בווייטנאמית, כדי לפתור את חולשת מודל הבסיס בשפה הזו.

במבחן השוואתי שנערך על בסיס נתונים משפטי מווייטנאם, Legal Zalo 2021, המודל הגיע לדיוק של 0.7274 בתוצאה הראשונה ולמדד MRR של 0.8181 בעשירייה המובילה. בשביל להבין את ההבדל, BGE-M3 המקורי השיג באותו מבחן רק 0.5682 ו־0.6822 בהתאמה. אם אתם בונים חיפוש שמתחרה בטקסטים מקומיים, מודל הבסיס הכללי פשוט לא מספק את אותה רמת דיוק.

מתאים ל

  • חיפוש סמנטי בווייטנאמית

    שליפת פסקאות ומסמכים רלוונטיים במאגרים הכתובים בשפה זו, עם דיוק גבוה משמעותית ממודלים כלליים.

  • מערכות RAG ייעודיות

    אחזור מידע מדויק עבור מודל שפה כשבסיס הידע המקומי שלכם כתוב כולו בווייטנאמית.

  • סיווג וסינון טקסט

    השוואת דמיון בין משפטים ומסמכים כדי לאתר כפילויות או לקבץ תכנים דומים ללא תיוג מראש.

איפה זה נופל

האימון נעשה עם אורך רצף מרבי של 2048 טוקנים בלבד, למרות שארכיטקטורת המקור יודעת לקבל מעל 8000. אם תנסו לדחוף מסמכים ארוכים יותר מחלון האימון, האיכות עלולה לרדת.

המודל אומן אך ורק על וייטנאמית. הוא לא מתאים לעברית, לאנגלית או לתרחישים רב-לשוניים שבהם המשתמש שואל בשפה אחת ומחפש באחרת. בנוסף, המדדים המוצהרים נבדקו על דאטה משפטי ספציפי, ועל אף שהיוצרים מדווחים על תוצאות טובות, יש להם כבר גרסה שנייה שמתאימה יותר למגוון תחומים רחב.

שאלות
נפוצות

האם כדאי להשתמש בו לטקסטים בעברית או באנגלית?

לא. המודל עבר כוונון ממוקד לווייטנאמית בלבד על גבי 300 אלף דוגמאות בשפה זו. לשפות אחרות, ובפרט לעברית, עדיף להשתמש במודל הבסיס BGE-M3 או במודלים ייעודיים אחרים.

האם יש צורך להשתמש בקוסינוס למדידת דמיון?

לא, היוצרים מציינים במפורש שיש להשתמש במכפלה סקלרית בין הווקטורים. הרצה של dot product נותנת את תוצאות הדמיון המתאימות ביותר למרחב שבו אומנו הווקטורים.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בשלוש שורות פייתון, ומחשבים דמיון בעזרת מכפלה סקלרית פשוטה. הקבצים שוקלים 4.3 גיגהבייט והמודל רץ בדיוק float32, כך שתוכלו להריץ אותו בלי שום בעיה על כרטיס מסך בסיסי או שרת ענן צנוע, אפילו עם זיכרון וידאו של 6 עד 8 גיגהבייט.

אם אתם מחזיקים שרתים בארץ ורוצים לשמור על זמני תגובה מהירים בלי תלות ברשתות חיצוניות, הרצה עצמית כאן קלה וזולה מאוד. אין צורך לחפש שירותי ענן יקרים של צד שלישי עבור מודל בגודל כזה, אלא אם אין לכם בכלל תשתית שרתים קבועה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("AITeamVN/Vietnamese_Embedding")
v = m.encode(["שלום עולם"])

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון פתוח שמתיר שימוש מסחרי מלא, שינוי הקוד ושילוב שלו במוצרים סגורים, בלי דרישה לחשוף את הפיתוחים שלכם. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים של היוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗