GPT
J

JoyAI-Image-Edit

קוד פתוח

jdopensourceapache-2.02026-03-31

  • safetensors
  • image-to-image
  • en
  • zh

הוראות טקסטואליות לעריכת תמונה עם שליטה מרחבית מדויקת. הוא מיועד למי שחייב להזיז אובייקטים לפי תיחום או לשנות זווית מצלמה בלי לפרק את הסצנה.

  • 47.1 GBמשקל הקבצים
  • 231הורדות בחודש
  • 138לייקים

מה זה

מדובר במודל מולטימודלי של jdopensource שמתמקד בעריכת תמונות מונחית הוראות, לצד יכולת יצירת תמונה מטקסט. הדגש כאן הוא הבנה מרחבית, פירוק ההוראה לחלקים וקישור ישיר בין הטקסט לאזורים מוגדרים בתמונה. הוא יודע לשנות צבעים ותכונות של פריטים, אבל הייחוד האמיתי שלו מול מודלים אחרים מגיע בשלוש משימות גיאומטריות מוגדרות: הזזת אובייקטים למיקום שמסומן בתיבה אדומה, סיבוב אובייקט ספציפי לזוויות קבועות, ושינוי נקודת המבט של המצלמה כולה לפי מעלות.

השליטה במצלמה כוללת פרמטרים מפורשים של זווית אופקית, זווית אנכית ורמת תקריב, תוך שמירה על העצמים המקוריים ללא שינוי. המודל מחזיק משקל משמעותי של 47.1 גיגה בייט המחולקים לעשרים וארבעה קבצים, מה שמעיד על ארכיטקטורה כבדה שמכילה רכיבי ראייה ויצירה משולבים. התמיכה הרשמית היא בשפות אנגלית וסינית, ואין בו תמיכה ישירה בעברית.

מתאים ל

  • הזזת פריטים מונחית תיבה

    העברת חפץ מוגדר בתמונה אל אזור שמסומן בתיבה אדומה והעלמת הסימון בתוצאה הסופית.

  • שינוי זווית צילום בסצנה

    סיבוב נקודת המבט לפי ערכי Yaw ו־Pitch מוגדרים תוך שמירה על העצמים המקוריים.

  • סיבוב מוצרים לתצוגה

    שינוי כיוון של רהיט או רכב לאחת משמונה זוויות קבועות בלי להחליף את הרקע.

איפה זה נופל

השליטה המרחבית קשיחה מאוד ואינה חופשית. כדי להזיז אובייקט אתם חייבים לצייר תיבה אדומה פיזית על גבי התמונה ולהשתמש בניסוח קבוע שכולל הוראה להסיר את התיבה בסוף. שינויי זווית מוגבלים לשמונה כיוונים מוגדרים מראש, כמו מבט ימין או שמאל קדמי, ולא לפי מעלות חופשיות. בנוסף, חובה להיצמד לתבניות טקסט מדויקות באנגלית או בסינית, ועברית פשוט לא נתמכת כאן.

שאלות
נפוצות

אפשר לפנות למודל בהוראות חופשיות בעברית?

לא. המודל תומך רשמית באנגלית ובסינית בלבד, ובמיוחד בעריכות מרחביות הוא תלוי בניסוחים קבועים לפי תבנית ספציפית כדי לפעול נכון.

האם כרטיס מסך של 16 גיגה בייט יריץ את המודל?

לא. המשקלים לבדם תופסים מעל 47 גיגה בייט בדיסק, כך שדרוש כרטיס מקצועי עם נפח זיכרון גדול בהרבה או חלוקה על פני מספר כרטיסים.

איך מריצים

כדי להריץ אותו מקומית תצטרכו סביבת פייתון מגרסה 3.10 ומעלה, PyTorch 2.8, חבילת diffusers עדכנית ומאיץ flash-attn מגרסה 2.8.0. הקבצים שוקלים 47.1 גיגה בייט, כך שכרטיס מסך ביתי רגיל לא יספיק פה. אתם חייבים כרטיס עם זיכרון וידאו עצום או מערך מרובה כרטיסים, כאשר הסקריפט הרשמי כולל פרמטר מובנה לפיצול המודל בין מספר כרטיסים באמצעות FSDP.

ברירת המחדל דורשת 50 צעדי דה-נויזינג ברזולוציית בסיס של 1024 פיקסלים. זה תהליך איטי וכבד חישובית. אם המטרה היא עריכה נקודתית בלי צורך בהרצה עצמאית מבודדת, שווה לבדוק את הדמו שרץ ב־Hugging Face Spaces או להמתין לעטיפת שירות, במקום להחזיק שרת יקר ייעודי.

pip install -U huggingface_hub
hf download jdopensource/JoyAI-Image-Edit

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה חופשית, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗