GPT
Q

Qwen-Image-Bench

קוד פתוח

Qwenapache-2.02026-05-21

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • judge-model

יש כאן גם סקירה על Qwen עצמו.

מודל שופט שמעריך איכות של תמונות שנוצרו מטקסט ומחזיר ציונים במבנה מסודר. הוא מתאים למי שרוצה לבדוק מודלי תמונה אוטומטית במקום לסמוך על עין אנושית.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 51.0 GBמשקל הקבצים
  • 39,120הורדות בחודש

מה זה

המודל הזה נבנה כמערכת ביקורת למחוללי תמונות. אתם מזינים לו את הפרומפט המקורי ואת התמונה שנוצרה, והוא בודק את התוצאה בחמישה ממדים שונים: איכות טכנית, אסתטיקה, התאמה לפרומפט, אמינות בעולם האמיתי ויצירתיות. במקום לפלוט תשובה חופשית ומעורפלת, הוא מריץ תהליך חשיבה פנימי ומחזיר אובייקט נתונים מפורט שבו כל קריטריון מקבל ציון נכשל, עובר או מצטיין.

המטרה העיקרית כאן היא החלפת בדיקות ידניות יקרות. במבחני הדירוג מול מומחים אנושיים, המודל הציג מתאם ספירמן של 0.92 בדירוג הכללי וציון של 0.89 בממדי איכות והתאמה. המספרים האלה אומרים שההחלטות שלו עקביות ומיישרות קו כמעט לגמרי עם טעם ובדיקה של בני אדם, מה שהופך אותו לשימושי בבניית תהליכי בדיקה מחמירים למודלים חדשים.

מתאים ל

  • בדיקת איכות למחוללי תמונות

    הרצת ציונים אוטומטית על סטים גדולים של תמונות כדי למדוד אם גרסת מודל חדשה טובה יותר מקודמתה.

  • סינון תוצאות שגויות בפייפליין

    זיהוי תמונות שנכשלו באנטומיה, עיוותי טקסט או אי התאמה להנחיות לפני שהן מגיעות למשתמשי הקצה.

  • בניית דאטה-סט לאימון

    סינון ודירוג כמויות גדולות של תמונות סינתטיות לפי איכות ויזואלית לצורך אימון מודלים עתידיים.

איפה זה נופל

הוא לא מודל שיחה ולא מייצר תמונות בעצמו. כל התפקיד שלו הוא שפיטה. הקלט שלכם חייב להיות מובנה בדיוק לפי הפורמט, כולל מזהה פרומפט, הטקסט ונתיב התמונה. המודל מוגבל לשפות אנגלית וסינית, כך שפרומפטים בעברית או תמונות עם טקסט בעברית עלולים להניב ציונים לא אמינים. נוסף על כך, מכיוון שהוא מפעיל מנגנון חשיבה מפורט לפני פליטת הציונים, כל הערכה לוקחת זמן יקר ולא מתאימה לזמן אמת.

שאלות
נפוצות

האם אפשר להשתמש בו כמחולל תמונות?

לא. המודל מקבל תמונה וטקסט כקלט, ומחזיר הערכה טקסטואלית במבנה של ציונים. הוא לא יודע לייצר או לערוך תמונות כלל.

האם הוא מבין פרומפטים בעברית?

הוא אומן רשמית על אנגלית וסינית בלבד. אם תתנו לו פרומפטים בעברית או תבקשו ממנו לבדוק תמונות שמכילות שלטים בעברית, הבדיקה של התאמת הטקסט תיכשל או תהיה שגויה לחלוטין.

איך מריצים

כדי להריץ אותו צריך חומרה כבדה. עם 27 מיליארד פרמטרים ומשקל קבצים של 51 גיגה-בייט, תצטרכו לפחות כרטיס מקצועי אחד עם 80 גיגה-בייט זיכרון כדי לטעון אותו ולבצע הסקה בקצב סביר. הקוד הרשמי רץ בעזרת ספריית swift ודורש סביבת פייתון מבודדת שבה מתקינים את התלויות ומריצים סקריפט ייעודי.

ההרצה המקומית מוגדרת עם פרמטרים קשיחים כדי לשמור על תוצאות שניתנות לשחזור, כמו טמפרטורה מאופסת ותקרת יצירה של 4,096 טוקנים לכל בדיקה. אם אתם צריכים רק לבדוק כמה עשרות תמונות בודדות ולא מריצים מערך הערכה שוטף על אלפי דוגמאות, להקים שרת ייעודי למפלצת כזו יעלה לכם יותר מדי זמן וכסף.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen-Image-Bench")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והרצה פנימית בלי תשלום תמלוגים. אתם יכולים לשלב אותו בתוך מוצר קיים או להשתמש בו בתוך החברה, בתנאי שאתם שומרים על הודעות זכויות היוצרים והרישיון המקורי בקבצים שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗