GPT
B

Bespoke-MiniCheck-7B

קוד פתוח

bespokelabsרישיון לא דווח2024-08-09

  • safetensors
  • internlm2
  • text-classification
  • custom_code
  • en

מודל ייעודי לאימות עובדות מול מסמכי מקור, שנועד לבדוק אם טענה נשענת על טקסט או ממציאה דברים. הוא שוקל פחות ממודלי ענק ומחזיר ציון ישיר בלי לייצר טקסט מיותר.

  • 7.7Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.4 GBמשקל הקבצים
  • 10,097הורדות בחודש

מה זה

במקום להשתמש במודל שיחה כללי שינסח תשובה ארוכה, מקבלים כאן מסווג שמקבל מסמך ומשפט בודד, ומוציא אפס או אחד לפי השאלה אם המסמך תומך בטענה. הבסיס שלו הוא internlm2_5-7b-chat, והוא אומן על 35 אלף דוגמאות בלבד, חלקן נתונים סינתטיים שנוצרו עם Llama-3.1-405B.

בבדיקה שפורסמה בכרטיס על בנצ'מרק LLM-AggreFact, שמבוסס על 11 מאגרי מידע מתויגים, המודל מציג דיוק מאוזן גבוה יותר מחלופות קטנות יותר כמו DeBERTa או RoBERTa. המשמעות בפועל היא פחות פספוסים של הזיות בטקסטים ארוכים, בלי הצורך לתחזק מודל ענק רק בשביל בדיקת אמינות.

מתאים ל

  • בדיקת הזיות במערכות RAG

    אימות מהיר של כל משפט שהמערכת פולטת ישירות מול פסקאות המקור שנשלפו מהמאגר.

  • בקרת איכות לסיכומי טקסט

    מעבר שורה אחר שורה על תקציר שנוצר אוטומטית כדי לוודא שאין בו פרטים שלא הופיעו במקור.

  • סינון דאטה לאימון מודלים

    ניקוי סטים של שאלות ותשובות לפני אימון, על ידי סינון תשובות שלא נשענות על הקשר נתון.

איפה זה נופל

הוא לא יודע לקבל פסקאות ארוכות בתור טענה. חובה לפרק את הטקסט שרוצים לבדוק למשפטים בודדים לפני ששולחים אליו, אחרת הדיוק יורד משמעותית. בנוסף, המודל אומן ותועד באנגלית בלבד, כך שאין שום הבטחה שיזהה עובדות או הטעיות בעברית. גם אם המסמך נכנס בחלון של 32K טוקנים, חלוקה שגויה של הטענות תוביל לתוצאות לא אמינות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות לבדיקת טקסטים בעברית?

לא כדאי להסתמך עליו בעברית. כרטיס המודל מגדיר שפה אחת בלבד שהיא אנגלית, וכל הנתונים שעליהם אומן נבנו בשפה זו. בדיקה בעברית צפויה לתת תוצאות לא יציבות.

האם אפשר להעביר לו מסמך מלא ופסקת סיכום שלמה בבת אחת?

המסמך יכול להיות מלא עד 32 אלף טוקנים, אבל את הסיכום צריך לפצל ידנית למשפטים בודדים. המודל יודע לתת ציון רק לטענה אחת בכל ריצה מול המסמך.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון לעבודה רגילה, או כרטיס חזק יותר כמו A6000 עם 48 גיגה אם רוצים לנצל את מלוא הקצב של vLLM, שמגיע ליותר מ־500 מסמכים בדקה לפי הבדיקות שלהם. המודל תומך בזיכרון מטמון אוטומטי של קידומות, מה שחוסך חישוב מחדש כשבודקים כמה טענות שונות מול אותו מסמך מקור.

אם אין לכם שרת עם GPU זמין ואתם בודקים רק כמה עשרות מסמכים ביום, החומרה הזו לא מצדיקה את העלות. במצב כזה, עדיף לבדוק את הגרסאות הקטנות יותר של MiniCheck שמבוססות על T5 או DeBERTa ורצות בקלות גם על מעבד רגיל.

pip install -U huggingface_hub
hf download bespokelabs/Bespoke-MiniCheck-7B

הרישיון

המודל שוחרר תחת רישיון CC BY-NC 4.0, מה שאומר שאסור להשתמש בו ישירות בתוך שירות או מוצר מסחרי. מי שרוצה להריץ אותו בסביבה עסקית או כחלק ממוצר בתשלום צריך לפנות ליוצרים ולקנות רישיון מסחרי ייעודי.

הרישיון המלא בעמוד המודל ↗