GPT
S

SenseNova-U1-8B-MoT-Infographic-V3

קוד פתוח

sensenovaapache-2.02026-07-15

  • transformers
  • safetensors
  • neo_chat
  • feature-extraction
  • multimodal

מודל של 18 מיליארד פרמטרים שמייצר אינפוגרפיקות ומאפשר לערוך בהן טקסט ואלמנטים ישירות. הוא מדבר למי שחייב לשנות נתונים בתמונה קיימת בלי להרוס את העיצוב מסביב.

  • 18Bפרמטרים
  • 32.7 GBמשקל הקבצים
  • 8,634הורדות בחודש
  • 60לייקים

מה זה

הארכיטקטורה כאן, NEO-unify, מוותרת לחלוטין על רכיבי קישור קלאסיים כמו מקודד תמונה נפרד או VAE. המודל מחבר טקסט ופיקסלים ישירות באותה רשת, ומאפשר ליצור אינפוגרפיקה מאפס וגם לערוך תמונה קיימת. בגרסה הזו אפשר להחליף מילים ספציפיות, לעדכן מספרים, להזיז אלמנטים ולשנות פריסה, בין אם מגדירים אזור מדויק עם מסגרת ובין אם מתארים את השינוי בטקסט חופשי.

במבחני עריכת תמונה פתוחים הוא מוביל כרגע, עם ציון ממוצע של 5.89 ב־WeEdit וציון של 7.89 ב־GEdit-Bench. במבחן הכללי Qwen-Image-Bench הוא הגיע ל־50.23, שיפור קל לעומת הגרסה הקודמת. המשמעות בפועל היא יכולת עקבית לשמור על הרקע והטיפוגרפיה המקורית כשמחליפים ערך בתוך תרשים, במקום לחרב את כל התמונה בכל פעם שמתקנים שגיאת כתיב.

מתאים ל

  • עדכון נתונים בתרשימים

    החלפת מספרים וכותרות בדשבורדים קיימים בלי לייצר את כל הגרפיקה מחדש.

  • תרגום ולוקליזציה של תוכן

    החלפת טקסט בשפה אחת לשפה אחרת תוך שמירה על הפונט, הנטייה והרקע המקוריים.

  • שינויי עיצוב וסגנון

    התאמת פלטת צבעים ופריסה כללית של אינפוגרפיקה מוכנה לפי הנחיות טקסט.

איפה זה נופל

למרות ההתקדמות בעריכה, יש כאן פשרה ברורה על איכות היצירה הגולמית. המפתחים מודים בעצמם שהאימון המשותף על עריכה ויצירה הוריד את הביצועים במבחן IGenBench בהשוואה לגרסה 2, שבה המודל התמקד רק ביצירת אינפוגרפיקות. בנוסף, חומרי ההדגמה מתמקדים באנגלית ובסינית, כך שאין שום הבטחה או בדיקה רשמית לגבי יכולת רינדור של עברית או יישור מימין לשמאל, וסביר להניח שטקסט מקומי ידרוש בדיקה מחמירה לפני כל שימוש.

אותה משפחה

SenseNova-U1-8B-MoT-Infographic יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי לשדרג מגרסה 2 אם אני רק מייצר אינפוגרפיקות חדשות?

לא בהכרח. גרסה 3 הורידה מעט מביצועי הדיוק של ייצור גרפיקה טהור לטובת יכולות העריכה, כך שאם אתם לא מתכננים לערוך תמונות קיימות, ייתכן שגרסה 2 תיתן מענה ממוקד יותר.

איך מסמנים למודל איזה חלק בתמונה לערוך?

אפשר להעביר תמונה עם סימון של מסגרת צבעונית מסביב לאזור הרצוי ולהנחות אותו מה להחליף בפנים, או פשוט לתאר במילים את הטקסט שרוצים להחליף והמודל יאתר אותו בעצמו.

איך מריצים

המשקל עומד על כמעט 18 מיליארד פרמטרים, מה שמיתרגם לכ־33 גיגה־בייט של קבצים בפורמט bfloat16. כדי להריץ אותו מקומית ברמת דיוק מלאה תצטרכו כרטיס מקצועי עם לפחות 40 גיגה זיכרון גרפי, כמו A100 או זוג כרטיסים קטנים יותר, אחרת המודל פשוט ייחנק עוד בשלב הטעינה.

למי שעובד על תחנת קצה או חומרה מוגבלת, קיימים קבצי GGUF מכווצים ומצבי חלוקת זיכרון שמאפשרים הרצה על כרטיס יחיד, לצד מתאמי LoRA מהירים של שמונה צעדים שפותחו לסדרה. אם אתם צריכים רק עריכות מזדמנות ולא בונים תשתית עצמאית, פנייה לשירותי ענן תחסוך את כאב הראש של תחזוקת שרת ייעודי.

from transformers import pipeline

pipe = pipeline("any-to-any", model="sensenova/SenseNova-U1-8B-MoT-Infographic-V3")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה של המערכת ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בתוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗