GPT
J

Janus-Pro-7B

קוד פתוח

deepseek-aimit2025-01-26

  • transformers
  • pytorch
  • multi_modality
  • muiltimodal
  • text-to-image

מודל שמבין תמונות וגם מייצר אותן באותה ארכיטקטורה. פתרון נוח למי שרוצה ראייה ממוחשבת ויצירה בלי לתחזק שני מודלים נפרדים.

  • 13.8 GBמשקל הקבצים
  • 11,268הורדות בחודש
  • 3,658לייקים

מה זה

מדובר במודל שמשלב הבנה ויזואלית ויצירת תמונות תחת שלד אחד של טרנספורמר, המבוסס על מודל השפה הבסיסי של דיפסיק בגודל שבעה מיליארד פרמטרים. במקום לנסות לדחוס את שתי המשימות לאותו מנגנון קידוד, הוא מפריד את נתיבי הקידוד הוויזואליים. להבנת תמונות הוא משתמש במקודד SigLIP ברזולוציה של שלוש מאות שמונים וארבע על שלוש מאות שמונים וארבע, וליצירת תמונות הוא נעזר בטוקנייזר ייעודי עם יחס דגימה של שש עשרה.

הגישה הזו פותרת את ההתנגשות המוכרת בין הדרישות של הבנת תמונה לבין הדרישות של יצירה מאפס. במקום להחזיק מודל דיפוזיה נפרד לתמונות ומודל שפה נפרד לניתוח, מקבלים מערכת אוטורגרסיבית יחידה שמבצעת את שתיהן ברמה שמקבילה למודלים ייעודיים.

מתאים ל

  • ניתוח ויצירה בעמדה אחת

    מאפשר לשאול על תמונה קיימת ומיד לבקש ממנו לייצר גרסה חדשה בלי להחליף מנוע.

  • מערכות שיחה מולטימודליות

    מתאים לבוטים שצריכים להבין תמונות שהמשתמש שלח ולהחזיר הדמיות ויזואליות כמענה.

  • מחקר על מודלים מאוחדים

    בסיס נוח למי שחוקר ארכיטקטורות שמפרידות קידוד הבנה מיצירה באותו שלד טרנספורמר.

איפה זה נופל

ההבנה הוויזואלית מוגבלת לתמונות ברזולוציה של שלוש מאות שמונים וארבע על שלוש מאות שמונים וארבע פיקסלים בלבד בגלל המקודד הנבחר. אם יש לכם מסמכים סרוקים, תרשימים צפופים או פרטים קטנים מאוד, המודל פשוט יפספס אותם או יטשטש אותם בגלל מגבלת הרזולוציה.

בנוסף, יצירת תמונות באופן אוטורגרסיבי דרך טוקנייזר ויזואלי נוטה להיות אטית וכבדה בחישוב ביחס למודלי דיפוזיה מודרניים. לא כדאי לבנות עליו לפרויקטים שדורשים תמונות בריאליזם גבוה במיוחד או ייצור תמונות בזמן אמת.

אותה משפחה

Janus-Pro יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יכול להחליף מודל ייעודי ליצירת תמונות?

לא ממש. הוא מסוגל לייצר תמונות לא רעות, אבל האיכות והמהירות לא משתוות למודלי דיפוזיה ייעודיים. היתרון שלו הוא היכולת לבצע גם הבנה וגם יצירה באותה מערכת, לא עליונות באיכות הגרפית.

איזה כרטיס מסך צריך כדי להרים אותו מקומית?

הקבצים שוקלים כמעט ארבעה עשר גיגה בייט בפורמט המקורי. תצטרכו כרטיס מסך עם עשרים וארבעה גיגה בייט זיכרון כדי לעבוד איתו בצורה חלקה, או להשתמש בשיטות כימות שיורידו את דרישות הזיכרון.

איך מריצים

כדי להריץ אותו בפורמט המקורי של bfloat16 תצטרכו כרטיס מסך עם לפחות שישה עשר עד עשרים וארבעה גיגה בייט זיכרון גרפי, בהתחשב בכך שקבצי המשקלים לבדם תופסים כמעט ארבעה עשר גיגה בייט. הקוד נשען על ספריית transformers ודורש הורדה של המאגר הרשמי של הפרויקט בגיטהאב כדי להפעיל את נתיבי הקידוד הנפרדים כראוי.

אם יש לכם רק חומרה מקומית חלשה או כרטיס צרכני פשוט, לא תצליחו לקבל זמני תגובה שפויים ביצירת תמונות. במצב כזה, עדיף להרים שרת ענן ייעודי עם כרטיס מתאים או להמתין שספקי צד שלישי יציעו גישה מנוהלת דרך ממשק תכנות.

from transformers import pipeline

pipe = pipeline("any-to-any", model="deepseek-ai/Janus-Pro-7B")
print(pipe("שלום"))

הרישיון

הקוד במאגר מוגדר תחת רישיון MIT שמאפשר שימוש חופשי, אך משקלי המודל עצמם כפופים לרישיון הדגמים של דיפסיק. אם אתם מתכננים לשלב אותו במוצר מסחרי, חובה לפתוח את תנאי הרישיון של המודל בקישור המצורף ולבדוק מה המגבלות על הפצה מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗