GPT
S

SenseNova-U1.5-8B-MoT-Preview

קוד פתוח

sensenovaapache-2.02026-07-28

  • transformers
  • safetensors
  • neo_chat
  • feature-extraction
  • multimodal

מודל משולב של 18 מיליארד פרמטרים ליצירה ועריכת תמונות שמביא רזולוציית 4K מקורית ורינדור טקסט מדויק, אך מוגדר בינתיים כגרסת תצוגה מוקדמת בלבד.

  • 18Bפרמטרים
  • 46.7 GBמשקל הקבצים
  • 1,787הורדות בחודש
  • 96לייקים

מה זה

הארכיטקטורה מבוססת על NEO-unify ללא מקודד ויזואלי נפרד, ומשתמשת בשכבות ConvDecoder כדי לפתור את בעיית החיבורים והעיוותים ברשת הפיקסלים שהופיעו בדור הקודם. הוא מטפל ביצירת תמונה מטקסט ובעריכה מונחית הוראות תוך שימוש במזהי מיקום כמו מסיכות ותיבות גבולות, ויודע לשמור על זהות האובייקט והמבנה המקורי.

במבחני Qwen-Image Bench הוא מציג ציון כולל של 49.93 באנגלית ו־50.25 בסינית, וכאשר מוסיפים שדרוג פרומפט הציון עולה ל־55.17. בעריכת תמונה הוא מגיע ל־4.37 במדד ImgEdit-Bench, מעל גרסת U1 הקודמת אך עדיין צמוד למודלים ייעודיים מתחרים. השיפור הניכר נובע בעיקר מסינון וסריקה מחדש של נתוני האימון לטובת התאמה טובה יותר בין טקסט באנגלית ובסינית לרכיבים גרפיים מורכבים.

מתאים ל

  • עריכת תמונות מונחית מיקום

    הוא קורא מסיכות ותיבות גבולות כדי לתקן אזור ספציפי מבלי להרוס את שאר הרקע.

  • עיצוב כרזות עם טיפוגרפיה

    הוא מרנדר טקסט באנגלית ובסינית ישירות לתוך הפריסה ברזולוציה גבוהה.

  • הפקת אינפוגרפיקה מורכבת

    הוא יודע לפרש מבנה של נתונים ופרומפטים ארוכים ליצירת דיאגרמות מרובות פרטים.

איפה זה נופל

זהו שחרור מוגדר של Preview, והמפתחים מציינים במפורש שגרסת מוצר יציבה טרם שוחררה. בנוסף, המודל אומן ותומך רק בשפות אנגלית וסינית, כך שאין טעם לנסות להזין לו פרומפטים בעברית או לצפות לרינדור טקסט עברי תקין. התוצאות מראות גם יתרון משמעותי לפרומפטים שמועשרים בכלים חיצוניים, מה שאומר שכתיבת הוראה פשוטה עלולה להפיק תוצאות פחות מרשימות מהמצופה.

אותה משפחה

SenseNova-U1.5-8B-MoT יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להכניס את גרסת ה־Preview הזו לפרודקשן?

לא מומלץ כרגע. היוצרים מציינים במפורש שמדובר במבט מוקדם על היכולות וכי גרסת ייצור יציבה ושלמה יותר צפויה להשתחרר בהמשך.

האם המודל יצליח לרנדר טקסט בעברית על גבי התמונות?

לא. נתוני האימון והתמיכה מוגבלים לחלוטין לאנגלית ולסינית, ולכן ניסיון להפיק כיתוב בעברית יוביל לשיבושים או לג'יבריש.

כמה זיכרון וידאו דרוש להרצה שלו במחשב מקומי?

המודל מגיע בנפח של 46.7 גיגה-בייט, כך שדרוש כרטיס עם לפחות 48 גיגה-בייט זיכרון כדי לטעון אותו ישירות בדיוק המקורי ללא כימות.

איך מריצים

המשקל הכולל של הקבצים עומד על 46.7 גיגה-בייט בפורמט bfloat16, מה שמחייב כרטיס גרפי מקצועי עם לפחות 48 עד 80 גיגה-בייט זיכרון כדי להריץ את המודל הגולמי בלי כימות. למרות שקיימת תמיכה קהילתית ב־GGUF למשפחה הזו, כרטיס ביתי סטנדרטי יתקשה מאוד להחזיק אותו בקצב סביר.

אם אתם רוצים רק לבדוק תאימות או לייצר תמונות בודדות בלי לנהל תשתית יקרה, פנייה ל־API או בדיקה בהדגמה החיה של היצרן עדיפה בהרבה על פריסה מקומית.

from transformers import pipeline

pipe = pipeline("any-to-any", model="sensenova/SenseNova-U1.5-8B-MoT-Preview")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעות זכויות היוצרים וההצהרות המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗