GPT
S

Sana_1600M_1024px

קוד פתוח

Efficient-Large-Modelapache-2.02024-11-04

  • sana
  • text-to-image
  • Sana
  • 1024px_based_image_size
  • en

מודל ליצירת תמונות בגודל 1.6 מיליארד פרמטרים שמיועד להפקה מהירה ברזולוציית 1024 פיקסלים. הוא מעניין בעיקר מפתחים שמחפשים ביצועים גבוהים מקומית על מחשב נייד בלי להחזיק שרת כבד.

  • 6.0 GBמשקל הקבצים
  • 666הורדות בחודש
  • 225לייקים

מה זה

המודל פותח על ידי צוותים מ־NVIDIA ופרויקט Sana, ומשלב ארכיטקטורת Linear Diffusion Transformer עם מקודד טקסט מסוג Gemma-2-2B-IT ומקודד תמונה דחוס בשם DC-AE. השילוב הזה נועד לייצר תמונות באיכות טובה ובהתאמה מדויקת לטקסט, תוך קיצור משמעותי בזמני החישוב.

במקום מודלי ענק שדורשים שרתי ענן מרובי כרטיסים, הוא תוכנן מראש לפעול ישירות על מעבדים גרפיים צרכניים של מחשבים ניידים. הדגש כאן הוא יעילות חישובית, כך שניתן לייצר תמונות ברזולוציה בסיסית של 1024 פיקסלים במהירות גבוהה, עם תמיכה ביחסי גובה־רוחב משתנים ובשפות אנגלית וסינית בלבד.

מתאים ל

  • יצירת אמנות ואיורים

    מתאים למעצבים שצריכים סקיצות ואיורים מהירים ברזולוציית 1024 פיקסלים ישירות מהמחשב.

  • שילוב בכלים חינוכיים

    משקל קל וריצה על חומרת קצה מאפשרים להטמיע אותו ביישומי לימוד מקומיים בלי עלויות שרת.

  • מחקר על מודלי דיפוזיה

    בסיס נוח לבדיקת ארכיטקטורות טרנספורמר ליניאריות, שיטות דגימה ומזעור הטיות במודלי תמונה.

איפה זה נופל

היוצרים מצהירים בפירוש שהמודל לא מגיע לפוטוריאליזם מושלם, ודחיסת התמונה של ה־autoencoder מאבדת מידע. בנוסף, הוא מתקשה באופן עקבי בייצור אצבעות ואיברי גוף, ולא מסוגל לייצר טקסט קריא ומורכב בתוך התמונות.

הוא גם לא אומן לייצג אנשים או אירועים אמיתיים, ולכן ייצור תוכן חדשותי או תיעודי אינו מתאים לו. לפני שמטמיעים אותו, קחו בחשבון שאין בו תמיכה בעברית והוא מועד להטיה חברתית כפי שמקובל במודלי יצירת תמונה.

שאלות
נפוצות

האם המודל מבין הנחיות בעברית?

לא. המודל אומן ותומך רק באנגלית ובסינית. כדי להשתמש בו באפליקציה ישראלית תצטרכו לתרגם את הפרומפטים לאנגלית לפני השליחה למודל.

האם אפשר לייצר איתו תמונות של מוצרים הכוללות כיתוב?

לא מומלץ. המפתחים מציינים במפורש שהמודל לא מסוגל לרנדר טקסט מורכב וקריא, כך שלוגואים, תוויות או שלטים ייצאו מרוחים או משובשים.

איך מריצים

המודל שוקל כ־6.0 גיגה־בייט ומיועד להרצה מקומית, כולל על מעבדים גרפיים של מחשבים ניידים. ההרצה נעשית דרך ספריית sana הייעודית או באמצעות הקוד במאגר ה־GitHub של NVlabs, שכולל דוגמי דיפוזיה מתקדמים כמו Flow-DPM-Solver.

אם אתם לא רוצים להגדיר את הסביבה והתלויות בעצמכם או לבזבז זיכרון מקומי, אפשר להשתמש בהדגמות הרשת שהועלו דרך Hugging Face או המעבדה ב־MIT. עם זאת, בזכות גודלו הקומפקטי, אין צורך אמיתי בתשתית ענן מורכבת כדי לקבל זמני תגובה טובים.

pip install -U huggingface_hub
hf download Efficient-Large-Model/Sana_1600M_1024px

הקבצים

5 קבצים במאגר, 6.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Apache 2.0, שמתיר שימוש חופשי ושינוי קוד. יחד עם זאת, מאחר שהוא משתמש במקודד Gemma-2-2B-IT, חלים עליו גם תנאי השימוש ומדיניות השימושים האסורים של Google Gemma. היוצרים מציינים בכרטיס שהכוונה היא למטרות מחקר, ולכן חובה לבדוק את מגבלות גוגל לפני שילוב במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗