GPT
J

Janus-1.3B

קוד פתוח

deepseek-aimit2024-10-18

  • transformers
  • safetensors
  • multi_modality
  • muiltimodal
  • text-to-image

מודל קומפקטי שמחבר הבנת תמונה ויצירת תמונה בארכיטקטורה אחת. מתאים למי שרוצה יכולות מולטימודליות על חומרה מקומית צנועה.

  • 2.1Bפרמטרים
  • 3.9 GBמשקל הקבצים
  • 4,002הורדות בחודש
  • 600לייקים

מה זה

המודל הזה מטפל בשתי משימות שלרוב דורשות מודלים נפרדים, הוא גם מנתח תמונות וטקסט וגם מייצר תמונות חדשות מאותו בסיס. כדי לפתור את ההתנגשות הקבועה בין קידוד לצורך הבנה לבין קידוד לצורך יצירה, הוא מפריד את נתיבי הראייה: קידוד ההבנה עובר דרך SigLIP-L, בזמן שיצירת התמונות מתבצעת בעזרת טוקנייזר ראייתי של LlamaGen עם יחס דחיסה של 16.

בבסיס שלו יושב מודל שפה שאומן על כ־500 מיליארד טוקנים של טקסט. במקום להחזיק מודל כבד לראייה ממוחשבת ועוד מודל דיפוזיה נפרד, הארכיטקטורה הזו מרכזת הכל בטרנספורמר אחד שמנהל את כל הקשרים בין המדיות השונות.

מתאים ל

  • מחקר מולטימודלי מקומי

    בדיקת אינטראקציה דו-כיוונית בין תמונה לטקסט על חומרה ביתית פשוטה בלי להרים שרתי ענק.

  • סיווג ותיאור תמונות קלות

    ניתוח ויזואלי של תמונות ברזולוציה בסיסית של 384 פיקסלים בעלות חישוב אפסית.

  • יצירת סקיצות ויזואליות מטקסט

    הפקת תמונות ראשוניות ישירות מתוך טרנספורמר בלי לתחזק צינור דיפוזיה כבד.

איפה זה נופל

הבנת התמונה מוגבלת לרזולוציית קלט של 384 על 384 פיקסלים בגלל מגבלות המקודד, כך שאי אפשר לצפות ממנו לפענח פרטים קטנים או מסמכים עמוסים. בנוסף, מודל שפה של 1.3 מיליארד פרמטרים שאומן על 500 מיליארד טוקנים בלבד סובל מהזיות ומידע כללי מוגבל, במיוחד בעברית שלא מופיעה בהגדרות שלו. לפני שילוב שלו צריך גם לוודא שמשתמשים בקובץ הטוקנייזר המתוקן, שכן בלעדיו יצירת התמונות נפגעת קשות.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ את המודל?

הקבצים שוקלים כ־3.9 גיגה, ולכן כרטיס עם 6 עד 8 גיגה זיכרון וידאו יספיק לעבודה רגילה בדיוק המקורי. זה מאפשר להריץ אותו גם על מחשבים אישיים בלי להזדקק לחוות שרתים.

האם המודל תומך בעברית בצורה טובה?

בסיס השפה אומן על 500 מיליארד טוקנים בלבד, בעיקר באנגלית ושפות מרכזיות אחרות. היכולת שלו להבין או לייצר טקסט בעברית צפויה להיות חלשה מאוד, ולא כדאי להסתמך עליו למשימות בשפה זו.

איך מריצים

כדי להריץ אותו בפועל תצטרכו כרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון גרפי, משום שמשקל הקבצים עומד על כמעט 4 גיגה בדיוק bfloat16. זה אומר שגם מחשב פיתוח נייד עם GPU סביר או שרת ענן קטן וזול יספיקו כדי לעבוד איתו בצורה מקומית בלי סיבוכים מיותרים. הטעינה נעשית ישירות דרך transformers, והקוד עצמו מנוהל במאגר הגיטהאב של הפרויקט.

אם יש לכם צורך בייצור תמונות ברזולוציה גבוהה מאוד, שימוש ב־API ייעודי למודלי דיפוזיה חיצוניים ייתן תוצאה טובה יותר. המודל הזה משתלם בעיקר כשרצים מקומית וצריכים חיבור ישיר ומהיר בין טקסט לתמונה בלי עלויות קריאה לשירותים חיצוניים ובלי תלות ברשת.

from transformers import pipeline

pipe = pipeline("any-to-any", model="deepseek-ai/Janus-1.3B")
print(pipe("שלום"))

הרישיון

הקוד ברישיון MIT חופשי לחלוטין, אך השימוש במשקלי המודל עצמם כפוף לרישיון הדגמים של החברה, DeepSeek Model License. זה אומר שחובה לבדוק את התנאים והמגבלות של הרישיון שלהם לפני שמשלבים את המודל במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗