GPT
D

dpr-question_encoder-single-nq-base

קוד פתוח

facebookcc-by-nc-4.02022-03-02

  • transformers
  • pytorch
  • tf
  • dpr
  • feature-extraction

זהו מקודד שאלות שממיר שאילתות באנגלית לוקטורים לשליפת מידע. הוא מיועד לחיבור ישיר למודל פסקאות תואם במערכות חיפוש מבוססות שאלות ותשובות.

  • 512טוקנים בהקשר
  • 836 MBמשקל הקבצים
  • 68,611הורדות בחודש
  • 36לייקים

מה זה

מדובר במודל שמבוסס על BERT base uncased וכולל 12 שכבות, שאומן ספציפית על מאגר Natural Questions של גוגל וויקיפדיה. התפקיד שלו הוא לקחת שאלה באנגלית ולהפיק ממנה וקטור מספרי שמייצג את הכוונה שלה, מתוך מטרה להתאים אותה לפסקאות טקסט שנשמרו מראש באינדקס וקטורי כמו FAISS.

בבדיקות המקוריות מול מאגרים שונים המודל הציג דיוק Top 20 של 78.4 אחוזים על Natural Questions, ודיוק Top 100 של 85.4 אחוזים. על מאגרים אחרים כמו SQuAD התוצאות צונחות ל־63.2 אחוזים ב־Top 20, מה שמראה שההתאמה שלו תלויה מאוד בסוג השאלות ובסגנון הניסוח שלהן. הוא פועל רק כחצי אחד ממערכת שלמה, ולא שולף או קורא טקסטים בעצמו.

מתאים ל

  • קידוד שאלות במערכות RAG

    הוא מפיק וקטורים מדויקים לשאילתות קצרות באנגלית מול אינדקס קיים.

  • מחקר על שליפת מידע

    הוא משמש כבסיס השוואה מקובל במחקרים של שאלות ותשובות פתוחות.

  • מנועי חיפוש לשאלות נפוצות

    הוא מתאים למיפוי שאלות משתמשים באנגלית מול מאגרי תשובות קצרים.

איפה זה נופל

המודל הזה לא מתאים לעברית. הוא אומן על אנגלית בלבד, וחלון ההקשר שלו מוגבל ל־512 טוקנים. הוא מסוגל לקודד רק שאלות, ולכן לא יעבוד לקידוד פסקאות המידע עצמן, משימה שדורשת מודל נפרד מאותה משפחה.

בנוסף, הכרטיס מציין במפורש שהמודל לא אומן לייצג עובדות היסטוריות או אמיתות על אנשים, והתוצאות שלו יכולות להכיל הטיות וסטריאוטיפים. אי אפשר להשתמש בו ישירות כתחליף למנוע חיפוש סמנטי כללי על מסמכים ארוכים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה כדי לחפש טקסטים בעברית?

לא, המודל אומן על טקסטים באנגלית בלבד. אם תזינו לו עברית תקבלו וקטורים חסרי משמעות שלא יניבו תוצאות חיפוש הגיוניות.

האם המודל יכול גם לקודד את המסמכים שעליהם מחפשים?

לא, המודל הזה מיועד אך ורק לשאלות. כדי לקודד את הפסקאות והמסמכים במאגר שלכם, עליכם להשתמש במודל המשלים שנקרא ctx_encoder.

האם אפשר לשלב אותו במוצר מסחרי שפתוח למשתמשים בתשלום?

לא, הרישיון של המודל הוא לא מסחרי ומגביל את השימוש למחקר, לימוד ובדיקות פנימיות בלבד.

איך מריצים

המודל שוקל 836 מגה בייט ודורש מעט מאוד משאבים. הוא רץ בקלות על מעבד רגיל של שרת או מחשב פיתוח, בלי צורך בכרטיס מסך ייעודי, באמצעות ספריית transformers של פייתון. האימון המקורי נעשה על שמונה כרטיסי מסך של 32 גיגה בייט, אבל הסקת מסקנות על שאילתה בודדת היא מהירה וקלה.

הוא מתאים להרצה מקומית אם אתם רוצים שליטה מלאה בזמני תגובה ואין לכם עניין לשלם על קריאות רשת. כדאי לפנות לפתרונות מנוהלים או שירותי ענן רק אם אתם לא רוצים לנהל בעצמכם את אינדקס הוקטורים ואת המודל הנוסף שדרוש כדי לקודד את הפסקאות.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="facebook/dpr-question_encoder-single-nq-base")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 836 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0, כלומר שימוש לא מסחרי בלבד. מותר לחקור אותו, לבדוק איתו היתכנות ולהריץ אותו במחקר אקדמי, אבל אסור לשלב אותו בכל מוצר שמייצר הכנסה או בעסק מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗