GPT
S

SenseNova-U1.5-8B-MoT

קוד פתוח

sensenovaapache-2.02026-08-19

  • transformers
  • safetensors
  • neo_chat
  • feature-extraction
  • native multimodal

מודל מולטימטודלי שמשלב יצירת תמונות, עריכה מקומית ושליטה מדויקת לפי טקסט ותמונות מקור. הוא מתאים למי שצריך תמיכה מובנית ברינדור טקסט בסינית ובאנגלית ברזולוציה גבוהה.

  • 18Bפרמטרים
  • 32.7 GBמשקל הקבצים
  • 8,283הורדות בחודש
  • 220לייקים

מה זה

במקום לחבר מודל שפה נפרד למודל דיפוזיה, הארכיטקטורה כאן נשענת על שלד מאוחד בשם NEO-unify שמטפל בהבנה וביצירה יחד. המודל מייצר תמונות מטקסט, עורך תמונות קיימות לפי בקשה, ויודע לשמור על מבנה הסובייקט המקורי בלי לדרוס את האזורים שמסביב. הוא תוכנן לעבודה מקורית בפורמט 4K ומציע שליטה באזורים מוגדרים בעזרת תיבות תוחמות או תמונות ייחוס.

ההבדל מול מודלים דומים מתבטא בשילוב של טיפול גרפי עם פריסה טקסטואלית נקייה. הוא מיועד לייצר פוסטרים ואינפוגרפיקות שבהם הטקסט עצמו קריא ומשולב ישירות בתוצאה, במיוחד בשפות אנגלית וסינית. הגרסה הזו עברה שלב אימון מבוסס תגמול, מה שמשפר את ההיענות להוראות מורכבות שמכילות כמה תנאים בו זמנית.

מתאים ל

  • עריכת תמונות ממוקדת

    החלפת פרטי לבוש או חפצים לפי תיאור טקסט תוך שמירה על הפנים, התאורה והרקע המקוריים.

  • יצירת אינפוגרפיקה וכרזות

    שילוב כותרות קריאות ומידע היררכי באנגלית ובסינית ישירות בתוך העיצוב הוויזואלי.

  • שליטה לפי תמונות ייחוס

    הנחיית העיצוב באמצעות תיבות תוחמות ודוגמאות מקור לייצור קומפוזיציה מדויקת.

איפה זה נופל

המודל עדיין מתקשה בפרטים קטנים ומורכבים. פרצופים קטנים, כפות ידיים ומבנה איברים מועדים לעיוותים, וטקסט ארוך, צפוף או מעורבב בין שפות מוביל לשגיאות כתיב ורינדור. בעריכות מרובות שלבים או מבוססות מספר מקורות יש נטייה לזליגה של שינויים לאזורים שהיו אמורים להישאר קבועים. בנוסף, הוא עלול לייצר צבעים רווים מדי ופירוט יתר, תופעה שהיוצרים מציעים למתן על ידי הורדת מדד ה־cfg_scale.

אותה משפחה

SenseNova-U1.5-8B-MoT יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לרנדר טקסט בעברית על גבי התמונות?

המודל הוגדר ואומן עבור שפות אנגלית וסינית בלבד. אין תמיכה מדווחת בעברית, כך שניסיון לייצר מילים בעברית בתוך התמונה צפוי להיכשל או להסתיים בתווים משובשים.

מה ההבדל בין גרסת הבסיס לגרסת SFT?

הגרסה הזו עברה שלב אימון נוסף עם למידת חיזוק שמחדד את היכולת לעקוב אחרי מגבלות והוראות מורכבות. גרסת ה־SFT עברה רק כוונון מונחה ועשויה להגיב פחות בעקביות לתנאים מרובים.

איך מריצים

הריצה המקומית דורשת סביבה מבוססת Python 3.11 עם PyTorch 2.8 וספריית CUDA 12.8 דרך הקוד שבמאגר הפרויקט. המשקלים שמורים בדיוק bfloat16 על פני 18 קבצים, כך שצריך כרטיס גרפי בעל נפח זיכרון משמעותי כדי לטעון אותם במלואם, או לחלק את המשאבים אוטומטית בין כמה מאיצים.

קיימת גרסה נוספת בשם SenseNova-U1.5-8B-MoT-SFT שעברה אימון מונחה בלבד, לעומת הגרסה הזו שעברה אופטימיזציה נוספת. אם אין לכם חומרה ייעודית מקומית עם מעבדים גרפיים כבדים, עדיף להשתמש בהדגמה בדפדפן דרך SenseNova-Studio במקום להסתבך עם הגדרת הסביבה והתקנת התלויות.

from transformers import pipeline

pipe = pipeline("any-to-any", model="sensenova/SenseNova-U1.5-8B-MoT")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והפצה מחדש בלי תשלום תמלוגים, בתנאי ששומרים על הודעות זכויות היוצרים וההצהרה המקורית. אתם יכולים לשלב אותו במוצרים פנימיים או חיצוניים בלי דרישה לפתוח את שאר הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗