GPT
F

Flow-Judge-v0.1

קוד פתוח

flowaicomapache-2.02024-09-15

  • transformers
  • safetensors
  • phi3
  • text-generation
  • lm-judge

במקום לשלם על מודל ענק שיבדוק פלטים של מודלים אחרים, אפשר להריץ שופט ייעודי קטן. הוא נבנה כדי להעריך טקסט לפי רובריקה מוגדרת ולהחזיר ציון עם נימוק.

  • 3.8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.1 GBמשקל הקבצים
  • 1,620הורדות בחודש

מה זה

מדובר במודל שנועד למשימה אחת ספציפית: לשפוט תוצרים של מערכות שפה. הוא מבוסס על הארכיטקטורה של Phi-3.5-mini ועבר אימון ייעודי על נתונים סינתטיים כדי לקבל קלט, להשוות אותו לקריטריונים שאתם מגדירים, ולהוציא משוב מנומק יחד עם ציון מספרי. הפלט מובנה ויוצא בתוך תגיות XML, מה שחוסך התעסקות עם פיענוח טקסט חופשי.

הוא תומך בשלושה סולמות בדיקה: מעבר או כישלון, סולם ליקרט של שלוש דרגות, וסולם של חמש דרגות. בבדיקות של היוצרים שלו על מערכי נתונים סגורים, הוא עקף מודלים כלליים גדולים ממנו בהרבה כמו Llama-3.1-8B ואפילו gpt-4o-mini בדיוק של בדיקות בינאריות, עם ציון F1 של 0.955 לעומת 0.910 של gpt-4o-mini. המשמעות היא שהוא מזהה שגיאות ועמידה בהגדרות בצורה עקבית יותר ממודל כללי שלא אומן להעריך.

מתאים ל

  • בדיקת איכות לאוטומציות

    מתאים לצינורות עיבוד שצריכים לסנן תשובות לא תקינות לפני שהן מגיעות למשתמשי הקצה.

  • הערכת ביצועים במבחני A/B

    מאפשר להשוות פלטים בין שני מודלים שונים על בסיס קריטריונים אחידים וציונים מובנים.

  • ניתוח עמידה בהנחיות פנימיות

    מוודא שטקסטים שנוצרו עומדים ברגולציה או בהגדרות סגנון מדויקות בעזרת נימוק מפורט.

איפה זה נופל

למרות שבמפרט הטכני של הארכיטקטורה רשום חלון הקשר ענק, המפתחים מודים במפורש שבגלל תהליך האימון המודל תומך בפועל רק עד 8,192 טוקנים. הוא גם לא נבדק לעומק על שפות שאינן אנגלית. בנוסף, כל האימון שלו התבסס על נתונים סינתטיים, מה שעלול לייצר הטיות עיוורות מול שפה אנושית מורכבת או מקרים שלא כוסו ביצירת הנתונים. חובה לבדוק אותו על דוגמאות אמיתיות שלכם לפני שמסתמכים על הציונים שלו באוטומציה מלאה.

שאלות
נפוצות

האם אפשר להשתמש בו כשופט לטקסטים בעברית?

המודל הוגדר ואומן באנגלית בלבד. המפתחים מציינים שתמיכה בשפות נוספות לא נבדקה לאחר האימון, ולכן לא מומלץ להסתמך עליו בעברית בלי לבצע בדיקות מקיפות תחילה.

האם המודל תומך במסמכים ארוכים?

לא. למרות שארכיטקטורת הבסיס מאפשרת חלון רחב, המודל הזה הוגבל באימון שלו לאורך מקסימלי של 8,192 טוקנים. ניסיון להזין קלטים ארוכים מזה יוביל לחיתוך או לתוצאות לא יציבות.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך מודרני עם לפחות 4GB של זיכרון וידאו, 8GB זיכרון מערכת, ושטח אחסון פנוי של 10GB עבור המשקלים והספריות. המשקל המלא הוא כ־7.1GB בפורמט bfloat16, כך שהוא עולה בלי בעיה על חומרה מקומית בסיסית. היוצרים מספקים ספרייה ייעודית בשם flow-judge שתומכת גם ב־Transformers וגם ב־vLLM לעבודה מהירה יותר.

קיימות גם גרסאות מכווצות בפורמטים AWQ ו־GGUF למי שמוגבל עוד יותר במשאבים. שווה להחזיק אותו על שרת עצמאי אם יש לכם נפח בדיקות קבוע או נתונים פנימיים שאסור להוציא החוצה. אם מדובר בבדיקה חד פעמית של כמה מאות דוגמאות, כנראה יהיה פשוט וזול יותר לפנות ל־API חיצוני מוכן.

from transformers import pipeline

pipe = pipeline("text-generation", model="flowaicom/Flow-Judge-v0.1")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקלים, שילוב במוצרים סגורים והפצה מחדש. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗