GPT
P

persian-embeddings

קוד פתוח

heydariAIapache-2.02024-11-21

  • transformers
  • safetensors
  • xlm-roberta
  • feature-extraction
  • fa

מודל שיודע לייצר וקטורים מדויקים לפרסית ואנגלית על בסיס ארכיטקטורת רוברטה. הוא מתאים למי שבונה חיפוש סמנטי או קלסטרינג וצריך מענה נקודתי לטקסטים בשפה הפרסית.

  • 560Mפרמטרים
  • 514טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 36,693הורדות בחודש

מה זה

מדובר בהתאמה ייעודית של מודל הבסיס הרב־לשוני לקורפוס פרסי רחב, שנועדה לתפוס ניואנסים לשוניים שלא נלמדים היטב במודלים כלליים. הוא מיועד לחילוץ מאפיינים ומייצר ייצוג וקטורי למשפטים ופסקאות קצרות, בדגש על פרסית אבל עם שימור היכולת לעבוד במקביל גם באנגלית. אם אתם עובדים מול מאגר מסמכים שכולל את שתי השפות האלה ורוצים למצוא קשרים ביניהם, זו בדיוק הנישה שלו.

המפתח לא פרסם בכרטיס תוצאות של מבחני ביצועים, מדדי השוואה מול מודלים אחרים או פירוט לגבי סט הנתונים המדויק שבו השתמש. המשמעות היא שאין פה ציון רשמי שאפשר להסתמך עליו, ואת רמת הדיוק מול מודלים רב־לשוניים רחבים יותר תצטרכו לבדוק בעצמכם על המידע שלכם לפני שמחליטים אם הוא עדיף.

מתאים ל

  • חיפוש סמנטי בפרסית

    שליפת פסקאות ותשובות ממאגרי ידע בפרסית ובאנגלית לפי משמעות ולא לפי מילות מפתח בלבד.

  • חלוקה לקבוצות נושא

    איחוד וסיווג אוטומטי של טקסטים קצרים ושאילתות משתמשים בשפה הפרסית.

  • התאמת טקסט דו־לשונית

    מדידת דמיון רעיוני בין משפטים באנגלית למשפטים בפרסית באותו מאגר נתונים.

איפה זה נופל

חלון ההקשר קצר מאוד ומגיע עד 514 טוקנים בלבד. אי אפשר לדחוף לתוכו מסמכים ארוכים, ספרים או דוחות בלי לחתוך אותם לפסקאות קטנות קודם. בנוסף, חוסר הפירוט על מקורות המידע והיעדר ציוני בדיקה בכרטיס מחייבים לבדוק ידנית שהוא לא מפספס ביטויים מקצועיים לפני שמשלבים אותו במערכת אמיתית.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

המודל אומן והותאם ספציפית לפרסית ולאנגלית. למרות שהוא מבוסס על שלד רב־לשוני, אין בכרטיס שום מידע על תמיכה או ביצועים בעברית, ולכן לא מומלץ להסתמך עליו למטרה זו.

האם הוא יודע לתרגם או לסכם תוכן?

לא. מדובר במודל שמחלץ וקטורים בלבד מתוך הטקסט ומיועד להשוואות ולחיפושים. הוא לא מודל יצירתי שמייצר מילים, תשובות או תרגומים.

איך מריצים

טוענים אותו ישירות דרך ספריית המשפטים של פייתון או דרך טרנספורמרס הרגילה, שבה נדרש גם לממש את פעולת האיחוד של הוקטורים בסוף. משקל הקבצים עומד על 2.1 גיגה בייט בדיוק מלא, כך שכל כרטיס מסך בסיסי או מעבד מודרני בשרת ענן יריצו אותו בלי בעיות מיוחדות של זיכרון.

אין כאן גרסאות מכווצות או מוקטנות שהועלו מראש, אלא רק המודל המלא. אם העומס שלכם נמוך ומדובר במעט שאילתות ביום, שימוש בשירות חיצוני קיים עשוי לחסוך תחזוקה, אבל כשצריך פרטיות מלאה או שמעבדים כמויות טקסט גדולות ברקע, כדאי להרים אותו עצמאית.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="heydariAI/persian-embeddings")
print(pipe("שלום"))

הרישיון

רישיון אפאצ'י שתיים אפס מתיר שימוש חופשי לחלוטין, כולל במוצרים מסחריים סגורים. מותר לשנות את הקוד, להטמיע אותו בשרתים שלכם ולמכור גישה, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗