GPT
H

hallucination_evaluation_model

קוד פתוח

vectaraapache-2.02023-10-25

  • transformers
  • safetensors
  • HHEMv2Config
  • text-classification
  • custom_code

יש כאן גם סקירה על Vectara עצמו.

במקום לשלם ל־OpenAI על כל בדיקת עובדות, המודל הזה בודק אם תשובה נאמנה לטקסט המקור. הוא קטן, שוקל 419 מגה־בייט ומיועד למערכות אחזור מידע.

  • 110Mפרמטרים
  • 419 MBמשקל הקבצים
  • 220,919הורדות בחודש
  • 364לייקים

מה זה

מדובר בממיין טקסט מבוסס T5 שמקבל שני קלטים, עובדת מקור והיפותזה, ומחזיר ציון התאמה בין 0 ל־1. התפקיד שלו מוגדר מאוד, לזהות אם הפלט של מודל שפה נשען על ההקשר שסופק לו בתוך תהליך אחזור מידע, או שהוא המציא פרטים על דעת עצמו.

בבדיקות מול AggreFact ו־RAGTruth, המודל הציג דיוק מאוזן של 74.28 אחוז במשימות שאלות ותשובות ו־64.42 אחוז בסיכום. המספרים האלה עוקפים במעט את GPT-4 בגרסת 06-13, שהגיע ל־74.11 אחוז ו־62.62 אחוז בהתאמה, ומשאירים מאחור את GPT-3.5. בניגוד לגרסה הקודמת שהוגבלה ל־512 טוקנים, לגרסה הזו אין מגבלת אורך הקשר רשמית, מה שהופך אותה לשימושית במסמכים ארוכים.

מתאים ל

  • בדיקת פלט במערכות RAG

    אימות שהתשובה שהופקה למשתמש נסמכת לחלוטין על פסקאות המקור שנשלפו ולא כוללת המצאות.

  • סינון תשובות של סוכנים

    בדיקת עקביות של פעולות וסיכומי ביניים מול מסמכי ההנחיות לפני החזרת מענה למשתמש.

  • בנצ'מרק עצמאי למודלי שפה

    מדידה והשוואה של רמות אמינות בין מודלים שונים בארגון בלי לשלם על קריאות חיצוניות.

איפה זה נופל

המודל הזה אומן על אנגלית בלבד. אם תזרקו עליו טקסטים בעברית, אין שום ערובה שהתוצאות יהיו שוות משהו. בנוסף, הוא בודק אך ורק עקביות יחסית למקור, לא אמיתות בעולם. אם המקור שלכם שגוי והתשובה תיקנה אותו לעובדה נכונה, המודל עדיין יסמן אותה כהזיה. בריצת טוקנים ארוכים הוא זורק אזהרה מובנית שמקורה במודל הבסיס T5, שצריך לסנן ידנית בקוד.

שאלות
נפוצות

האם המודל תומך בבדיקת טקסטים בעברית?

הגרסה הפתוחה הזו אומנה לשפה האנגלית בלבד, ואין בה תמיכה רשמית בעברית. שימוש בה לטקסט מקומי יוביל לתוצאות לא יציבות. לתמיכה רב־לשונית החברה מפנה לגרסה המסחרית שלהם.

למה שהמודל יסמן עובדה נכונה כהזיה?

הבדיקה אינה מול המציאות אלא אך ורק מול טקסט המקור. אם ההקשר טוען שפריז היא בירת גרמניה והפלט תיקן לברלין, המודל ידרג את זה כהזיה כי הפלט סותר את המקור שסופק.

איך מריצים

המשקל הכולל עומד על 419 מגה־בייט, ובדיוק המקורי של 32 ביט הוא תופס פחות מ־600 מגה־בייט בזיכרון ה־RAM. מעבד x86 מודרני מסיים עיבוד של 2,000 טוקנים בסביבות שניה וחצי, כך שאין שום חובה להחזיק כרטיס מסך ייעודי כדי להרים אותו.

מריצים אותו ישירות דרך ספריית transformers בפייתון באמצעות AutoModel או pipeline רגיל. שווה להחזיק אותו עצמאית כשרוצים לחסוך עלויות קריאה ולשמור מידע רגיש בתוך הרשת המקומית, אבל אם אתם צריכים תמיכה בריבוי שפות או דיוק גבוה יותר, המפתחים מציעים את גרסה 2.3 המסחרית שזמינה רק כחלק מהענן של Vectara.

from transformers import pipeline

pipe = pipeline("text-classification", model="vectara/hallucination_evaluation_model")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 419 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו ברישיון Apache 2.0 מלא. אפשר להשתמש במודל במוצרים מסחריים, לשנות אותו, להפיץ אותו ולהריץ אותו בשרתים פרטיים בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗