GPT
P

provence-reranker-debertav3-v1

קוד פתוח

navercc-by-nc-nd-4.02024-12-11

  • safetensors
  • Provence
  • text-ranking
  • custom_code
  • en

במקום רק לדרג תוצאות חיפוש, המודל הזה מנקה מתוכן משפטים מיותרים לפני שהם מגיעים ל־LLM. הוא חוסך טוקנים ומפחית רעש בתוך צנרת RAG באנגלית.

  • 435Mפרמטרים
  • 512טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 2,748הורדות בחודש

מה זה

המודל פותח על בסיס DeBERTa-v3-large ואומן לבצע שתי פעולות במקביל: חישוב ציון רלוונטיות של פסקה לשאלה, וסינון משפטים לא קשורים מתוך אותה פסקה. כל המשפטים מקודדים יחד, כך שהוא מבין הקשרים בין משפטים ולא שופט כל שורה בנפרד. האימון התבסס על MS Marco ו־Natural Questions, כאשר התיוג למשפטים שצריך להשאיר נוצר בעזרת LLaMA-3-8B.

בבדיקות של החוקרים על שבעה מאגרי נתונים, שכוללים תחומים כמו רפואה, חדשות וויקיפדיה, הסינון הצליח לקצץ בטקסט כמעט בלי לפגוע בדיוק התשובות הסופיות. החיסכון העיקרי כאן אינו בזמן החיפוש עצמו, אלא בעלות ובזמן הריצה של מודל השפה הגדול שמקבל פחות טוקנים לעבד.

מתאים ל

  • קיצוץ הקשר ב־RAG

    צמצום פסקאות שנשלפו ממאגר ידע לפני שליחתן למודל שפה, כדי לחסוך טוקנים ולשפר זמני תגובה.

  • דירוג מחדש וסינון משולב

    ביצוע reranking של מסמכים ובמקביל הסרת משפטים לא רלוונטיים באותו מעבר חישובי באנגלית.

  • מחקר וניסויי דחיסה

    בדיקת השפעת סינון רעשים על איכות התשובות של מודלי שפה במסגרת מחקרית לא מסחרית.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים בלבד, בדיוק כמו המודל המקורי שעליו הוא נשען. פסקאות ארוכות או שאלות מורכבות פשוט ייחתכו, מה שמחייב חלוקה מוקדמת של הטקסט למקטעים קצרים.

הוא מאומן באנגלית בלבד ולא יתאים לטקסטים בעברית. בנוסף, המודל מסתמך על חלוקת משפטים תקינה, כך שבטקסטים לא אחידים, קוד או מסמכים טכניים ללא מבנה ברור, מנגנון הסינון עלול למחוק מידע חיוני או להשאיר זבל.

שאלות
נפוצות

האם אפשר להשתמש בו לצנרת RAG בעברית?

לא. המודל אומן על נתונים באנגלית בלבד ואינו תומך בעברית. עבור שפות נוספות Naver שחררו גרסה רב־לשונית נפרדת שמבוססת על BGE-M3.

איך שולטים ברמת הסינון של המשפטים?

השליטה נעשית דרך פרמטר ה־threshold בפונקציית העיבוד. ערך ברירת המחדל הוא 0.1 לשמירה זהירה על התוכן, ואפשר להעלות אותו לאזור 0.5 לקבלת קיצוץ אגרסיבי יותר של משפטים.

איך מריצים

המודל שוקל 1.6 גיגה־בייט ודורש מעט מאוד משאבים ביחס לעולם ה־LLM. כרטיס מסך בסיסי עם 4 עד 8 גיגה זיכרון יריץ אותו בקלות, וגם על מעבד רגיל אפשר לעבוד אם כמות השאילתות נמוכה.

הריצה דורשת התקנה של NLTK להפרדת משפטים ומבוצעת דרך פונקציית process עם פרמטרים כמו סף סינון, גודל אצווה ואפשרות לדירוג מחדש. אם אתם מחפשים תמיכה בשפות נוספות, קיימת גרסה רב־לשונית נפרדת שמבוססת על BGE, אך הגרסה הנוכחית מוגבלת לחלוטין לאנגלית.

pip install -U huggingface_hub
hf download naver/provence-reranker-debertav3-v1

הרישיון

הרישיון המוגדר הוא לא מסחרי (מופיע ברישום כ־CC BY-NC-ND 4.0 ובטקסט כ־CC BY-NC 4.0). המשמעות חדה: אסור לשלב אותו בשום מוצר מסחרי, שירות בתשלום או פעילות עסקית מניבה. השימוש מותר אך ורק למחקר, ניסויים פנימיים ופיתוח אקדמי.

הרישיון המלא בעמוד המודל ↗