GPT
Q

Qwen/Qwen-Image-Bench

קוד פתוח

Qwenapache-2.02026-05-21

  • text-to-image
  • image-generation
  • benchmark
  • evaluation

יש כאן גם סקירה על Qwen עצמו.

המאגר מכיל אלף פרומפטים דו-לשוניים והערכות של 18 מודלים ליצירת תמונות. הוא נבנה עבור מפתחים שרוצים לבדוק איכות ויזואלית, התאמה לטקסט ונאמנות למציאות לפי סטנדרטים מקצועיים.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 51.0 GBמשקל הקבצים
  • 8,420הורדות בחודש

מה זה

הנתונים כוללים אלף שורות בפורמט JSONL, שכל אחת מהן מייצגת פרומפט ייעודי שנבנה בשיתוף אנשי מקצוע מעולמות האמנות והעיצוב. מחצית מההנחיות קצרות ומחציתן ארוכות, והן נכתבו באנגלית ובסינית כדי לבחון מגוון רחב של תרחישים יצירתיים. כל רשומה כוללת את מזהה הפרומפט, ניסוחי הטקסט בשתי השפות, רשימת ממדי הבדיקה הרלוונטיים, נתיבים לתמונות שנוצרו בידי 18 מודלים מובילים, ותשובות שיפוט גולמיות.

מערכת הניקוד בנויה בהיררכיה של חמישה ממדי על: איכות בסיסית, אסתטיקה, התאמה להנחיה, נאמנות לעולם האמיתי ויצירתיות. אלה מתפצלים ל־23 תת-יכולות ול־56 מדדים ממוקדים, כמו עיצוב גרפי, רינדור טקסט ואנטומיה. המאגר מציג תוצאות עבור מודלים שונים, בהם GPT Image 2, גרסאות של Nano Banana, וסדרות Seedream ו־Qwen.

מתאים ל

  • השוואת מודלי תמונה

    הרצת מודל פנימי מול 1,000 הפרומפטים כדי לקבל ניקוד מפורט ב־56 מדדי איכות.

  • אבחון פערי איכות ויזואלית

    בדיקת התנהגות מודלים במשימות מורכבות כמו רינדור טקסט, אנטומיה ושמירה על חוקי פיזיקה.

  • אימון מודלי שיפוט

    שימוש בתשובות המודלים ובדירוגים הקיימים כבסיס לפיתוח שופטי הערכה אוטומטיים לתמונות.

איפה זה נופל

המאגר מוגבל לשפות אנגלית וסינית בלבד, כך שאין בו כיסוי לפרומפטים בעברית או לטקסט מקומי בתמונות. לוח התוצאות הקיים חושב על סמך התמונות שנוצרו מההנחיות בסינית, בעוד התוצאות להנחיות באנגלית טרם נכללו בו. בנוסף, הנתונים עצמם מראים תקרה טכנולוגית ברורה בכל המודלים שנבדקו בתחומים כמו לוגיקה פיזיקלית, ציור בעלי חיים ודיוק אנטומי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

כן, רישיון Apache 2.0 מאפשר שימוש מסחרי מלא בקוד ובנתונים. עליכם לכלול את עותק הרישיון ואת הצהרות זכויות היוצרים של הפרויקט בכל הפצה.

האם המאגר תומך בבדיקות של פרומפטים בעברית?

לא. הפרומפטים הוכנו באנגלית ובסינית בלבד, והערכות המודלים הקיימות מבוססות על ההנחיות בסינית. בדיקת איכות עבור שפה או תרבות ישראלית תדרוש תרגום והתאמה עצמאית של המדדים.

איך נאספו ודורגו הנתונים במאגר?

ההנחיות נכתבו בידי מומחים ואמנים, והתמונות נוצרו באמצעות 18 מודלים שונים. הציונים הופקו בעזרת מודל שופט בשם Q-Judger שאומן על יותר מ־130,000 זוגות תמונה-טקסט מתויגים בידי 80 מדרגים מקצועיים.

כמה קבצים כולל הפרויקט והאם צריך חומרה ייעודית?

המאגר מכיל מעל 18,000 קבצים הכוללים את התמונות שנוצרו על ידי כל המודלים, קוד להרצה וקבצי הגדרות. לחישוב ציונים מתשובות קיימות מספיק מחשב רגיל, אך הרצת מודל השופט על תמונות חדשות דורשת סביבת עבודה עם מעבדי GPU מותאמי PyTorch.

איך מריצים

השימוש במאגר מתבצע על ידי הורדת קובץ ה־JSONL וסקריפטי הפייתון המצורפים ישירות מ־HuggingFace או ModelScope, ללא צורך בהרשאות גישה מיוחדות. הריצה המקומית דורשת סביבת פייתון 3.11, התקנת PyTorch לפי כרטיס המסך שלכם, וחבילות מתוך requirements.txt שכוללות את ms-swift. אפשר להריץ את compute_scores.py לחישוב ממוצעים מהתשובות הקיימות, או להשתמש ב־judge.py ובמודל השופט הייעודי כדי להעריך תמונות חדשות לפי מזהי הפרומפטים.

pip install -U huggingface_hub
hf download Qwen/Qwen-Image-Bench

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים והקוד ללא תשלום תמלוגים, ואינו מחייב שיתוף של תוצרים באותו רישיון. תנאי השימוש דורשים שימור של הודעות זכויות היוצרים והצהרת הרישיון המקורית בכל הפצה של הנתונים או של חלקי קוד שנלקחו ממנו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗