GPT
M

MiniMax-H3-Single-Frame-VAE-500K

קוד פתוח

iamkaikaiרישיון לא דווח2026-08-20

  • diffusers
  • minimax-h3
  • vae
  • decoder
  • image-reconstruction

פענוח תמונה בודדת מתוך מרחב הלטנט של MiniMax H3, שמיועד למי שצריך לחלץ פריים יחיד עם חדות גבוהה בדיאגרמות ושרטוטים.

  • 9.1 GBמשקל הקבצים
  • 19,111הורדות בחודש
  • 54לייקים

מה זה

זהו פענח בלבד, ללא אנקודר וללא מודל טרנספורמר מלא, שעבר אימון על חצי מיליון דוגמאות שחזור כדי לפענח פרוסת זמן בודדת מתוך רצף לטנט. המודל מתמקד בקווים ישרים, שרטוטי מוצר, מסמכים וממשקי משתמש, שבהם הוא מציג חדות מבנית עדיפה על פני פתרונות קהילתיים קודמים.

במדד הדיוק הממוצע ברמת הפיקסל הוא מגיע ל־31.1185 דציבלים ועוקף את הפענח הרשמי, בעיקר בדיאגרמות שבהן הוא מוביל בכל הפרמטרים. מנגד, במדדי תפיסה חזותית כמו LPIPS ו־DISTS הפענח הרשמי של H3 עדיין עדיף, מה שאומר שבצילומי טבע ובטקסטורות עדינות התוצאה שלו פחות טבעית לעין האנושית.

מתאים ל

  • חילוץ שרטוטים ודיאגרמות

    שחזור גרפיקה טכנית מתוך לטנט של H3, שבה הוא עוקף את הפענח הרשמי בכל מדדי החדות.

  • ייצוא צילומי מוצר מ־H3

    שמירה על קווי מתאר חדים וחומרים מוגדרים היטב בפריים בודד שנבחר מתוך רנדר.

  • מחקר על מרחב לטנט

    בדיקת שחזור והתנהגות של פרוסות זמן מבודדות ללא צורך בהרצת רצף וידאו מלא.

איפה זה נופל

הפענח מיועד לתמונה בודדת בלבד, וניסיון לפענח איתו וידאו שלם מייצר הבהובים, עיוותי רשת וקפיצות במרקם לאורך הזמן. בצילומי טבע הוא מאבד פרטים בהשוואה לפענח המקורי, טקסט זעיר בתוך תמונות מאבד צורה ונהיה בלתי קריא, ודוגמאות חוזרות כמו לוחות שחמט או פסים צפופים יוצרות עיוותי מוארה. בעריכת תמונה מבוססת פריים ראשון נדרש חיפוש ידני בין כמה פרוסות זמן, ושינויים מאוחרים נוטים להזיז תאורה, גאומטריה ופרטים שלא ביקשתם לשנות.

שאלות
נפוצות

אפשר להשתמש במודל הזה כדי לייצר תמונה ישירות מטקסט?

לא באופן עצמאי. זהו רק פענח, ולכן תצטרכו להריץ קודם את המודל המלא של H3 שמייצר רצף לטנטים של וידאו ואודיו, ואז להזין פרוסת זמן אחת לתוך הפענח הזה.

האם הוא מתאים לשחזור וידאו מלא באיכות גבוהה?

ממש לא. האימון התבצע על תמונות סטטיות בודדות ללא פיקוח על עקביות בזמן, ופענוח רצף שלם יוצר הבהובים, עיוותי בלוקים ומריחות קשות בין הפריימים.

איך מריצים

המשקל הכולל מגיע ל־9.1 גיגהבייט וכולל 585 טנסורים של שכבות הפענוח בלבד. ההרצה דורשת כרטיס מסך תומך CUDA עם זיכרון ייעודי שמחזיק את המודל ואת רצף הלטנטים בפורמט safetensors, כאשר תהליך הטעינה הראשוני מבצע אימות גיבוב מלא של הקובץ ונמשך מספר שניות.

מאחר שהפקת הלטנט עצמו נעשית בתהליך יצירת וידאו מלא של H3, העלות החישובית כבדה בהרבה ממודל תמונה רגיל. אם אתם צריכים רק תמונה מטקסט ולא מחקר ספציפי על הלטנט של H3, עדיף לפנות ל־API ייעודי ליצירת תמונות ולא להריץ צינור וידאו מלא רק כדי לקלף ממנו פריים אחד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("iamkaikai/MiniMax-H3-Single-Frame-VAE-500K")
img = pipe("a photo").images[0]

הקבצים

65 קבצים במאגר, 9.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון בעמוד הרשמי מוגדר כלא דווח, אך בתיעוד מצוין כי זהו נגזרת של MiniMax H3 הכפופה להסכם הרישיון הקהילתי של החברה המקורית. ההסכם כולל הגבלות טריטוריאליות ומגבלות שימוש, ולכן שימוש מסחרי או הפצה בתוך מוצר דורשים בדיקה משפטית של תנאי הרישיון המקורי והודעות השינוי הנלוות.

הרישיון המלא בעמוד המודל ↗