GPT
H

HyperCLOVAX-SEED-Omni-8B

קוד פתוח

naver-hyperclovaxother2025-12-23

  • transformers
  • diffusers
  • safetensors
  • vlm
  • text-generation

מודל מולטימודלי מלא שמקבל ופולט טקסט, תמונה ואודיו תחת ארכיטקטורה אחת. הוא פונה למי שצריך תמיכה מעמיקה בקוריאנית ומחפש אלטרנטיבה פתוחה למודלים סגורים.

  • 11Bפרמטרים
  • 8,192טוקנים בהקשר
  • 45.8 GBמשקל הקבצים
  • 2,823הורדות בחודש

מה זה

מדובר במודל צפוף של כמעט 11 מיליארד פרמטרים מבית נאבר הקוריאנית. הרעיון כאן הוא יכולת תנועה חופשית בין מדיות שונות: אתם מזינים טקסט, תמונה, וידאו או אודיו, ומקבלים בחזרה טקסט, תמונה ערוכה או קובץ קול, בלי לשרשר מודלים נפרדים לכל משימה.

במבחני הביצועים הוא מציג תוצאות בטקסט, ראייה ממוחשבת ושמע, עם דגש בולט על מבחנים קוריאניים כמו KMMLU-Pro ו־Ksponspeech לצד מבחנים סטנדרטיים באנגלית כמו GSM8K ו־MMLU-Pro. הוא מכוון ישירות לשוק שבו שפות אסייתיות, ובעיקר קוריאנית, מקבלות עדיפות ראשונה ולא נדחקות הצידה.

מתאים ל

  • תרגום קולי מאנגלית לקוריאנית

    הוא כולל ארכיטקטורת שמע מובנית שיודעת לקבל דיבור באנגלית ולתרגם ישירות לפלט קולי בקוריאנית.

  • עריכת תמונות לפי הוראות טקסט

    המערכת מקבלת תמונה והוראה מילולית ומחזירה תמונה ערוכה בלי צורך במודל דיפוזיה נפרד.

  • ניתוח מסמכים ותמונות בקוריאנית

    הוא נבנה ונבדק במיוחד על בנצ'מרקים של הבנת תמונה ושפה בקוריאנית ברמת דיוק גבוהה.

איפה זה נופל

המודל הזה לא מייצר וידאו, אלא רק מנתח אותו כקלט. בנוסף, חיתוך הידע שלו עומד על מאי 2025 ומשקל הקבצים להורדה מגיע לכמעט 46 גיגה־בייט בדיוק מלא, מה שהופך את כל תהליך הפריסה למסורבל. החיסרון המשמעותי למפתח הישראלי הוא המיקוד: המודל תוכנן סביב קוריאנית ואנגלית, כך שאין שום הבטחה או בדיקה לגבי יכולות עיבוד של עברית.

שאלות
נפוצות

האם המודל יודע לדבר ולעבד עברית?

הכרטיס והתיעוד מציינים מפורשות גישה של קוריאנית תחילה לצד אנגלית. אין שום התייחסות לתמיכה בעברית, ולכן יש להניח שרמת הביצועים בשפה תהיה נמוכה ולא מתאימה למוצר.

למה צריך אחסון S3 כדי להריץ אותו?

בניגוד למודלי טקסט רגילים שמחזירים מחרוזת, המודל הזה מייצר גם קבצי תמונה ושמע בינאריים. השרת שומר את הקבצים הללו באחסון ענן ומחזיר ללקוח כתובת מקודדת כדי למנוע עומס על הזיכרון.

איך מריצים

כדי להריץ אותו לא תספיקו עם כרטיס ביתי פשוט. הדרישה הרשמית היא שרת עם 4 כרטיסי NVIDIA A100 של 80GB, כיוון שהרכיבים השונים תופסים יחד עשרות גיגה־בייט של זיכרון ומחולקים בין אנקודרים ודיקודרים שונים לראייה, שמע וטקסט.

ההרצה מתבצעת דרך מערכת ייעודית בשם OmniServe בתוך קונטיינרים של דוקר, וכוללת המרת מודל מראש וחיבור לאחסון S3 בשביל פלט של תמונות וקבצי קול. אם אין לכם גישה לתשתית ענן כבדה כזו, עדיף להמתין לממשק API מסודר מאשר לנסות להרים אותו על שרת בודד.

from transformers import pipeline

pipe = pipeline("text-generation", model="naver-hyperclovax/HyperCLOVAX-SEED-Omni-8B")
print(pipe("שלום"))

הקבצים

46 קבצים במאגר, 45.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית תחת הסכם רישוי ייעודי של נאבר ולא כרישיון קוד פתוח מוכר. לפני שמשלבים אותו במוצר מסחרי, חובה לפתוח ולקרוא את קובץ הרישיון המצורף כדי לבדוק הגבלות שימוש, הפצה ומסחור.

הרישיון המלא בעמוד המודל ↗