GPT
H

HyperCLOVAX-SEED-Vision-Instruct-3B

קוד פתוח

naver-hyperclovaxother2025-04-22

  • transformers
  • safetensors
  • hyperclovax_vlm
  • text-generation
  • conversational

מודל ראייה ושפה קטן של ענקית הרשת הקוריאנית NAVER, שמתמקד בניתוח תמונות וסרטונים בקוריאנית עם שימוש מינימלי בטוקנים.

  • 3.7Bפרמטרים
  • 131,072טוקנים בהקשר
  • 13.9 GBמשקל הקבצים
  • 10,021הורדות בחודש

מה זה

מדובר במודל שמשלב ליבת טקסט של 3.2 מיליארד פרמטרים עם מקודד ראייה מבוסס SigLIP של 0.43 מיליארד פרמטרים. המטרה העיקרית שלו היא להציע הבנת תמונות, דיאגרמות וסרטונים בלי לחנוק את הזיכרון. בעוד שמודלים כמו Qwen 2.5 שורפים עשרות אלפי טוקנים על וידאו, כאן סגרו את התקרה על 1,856 טוקנים ל־108 פריימים, מה שמקצץ את זמן העיבוד בריצת הסקה.

בבנצ'מרקים קוריאניים ממוקדי וידאו כמו NAVER-TV-CLIP ו־VideoChatGPT הוא עוקף את המתחרים בגודל שלו, אבל ברגע שלוקחים אותו למבחנים רחבים יותר באנגלית, כמו PerceptionTest, היתרון שלו נעלם מול דגמים מקבילים. כל הדגש כאן הוא יעילות חישובית ותמיכה חזקה בשוק הקוריאני.

מתאים ל

  • ניתוח וידאו בקוריאנית

    דוחס 108 פריימים לפחות מ־2,000 טוקנים, מה שמאפשר מעקב זול ומהיר יחסית על תכני וידאו.

  • מענה שאלות על מסמכים

    מתאים לפענוח תרשימים ודיאגרמות כשיש לצד התמונה שכבת OCR חיצונית שמשלימה את הטקסט.

  • הסקה חסכונית במשאבים

    רץ בשלמותו על חומרה צנועה בזכות גודל של פחות מארבעה מיליארד פרמטרים.

איפה זה נופל

החולשה הכי ברורה מגיעה מההודאה של היוצרים עצמם: כדי להגיע לתוצאות טובות באמת בתמונות, צריך להזין לו מראש טקסט חילוץ חיצוני כמו OCR וזיהוי ישויות. בבנצ'מרק KoNet, המודל צולל מציון של 69.2 ל־36.6 כשמריצים אותו בלי נתוני OCR מוכנים. מעבר לזה, המודל אומן על מידע שנאסף עד אוגוסט 2024, ולמרות שמטא־הדאטה מציג הקשר ענק, הכרטיס עצמו מגדיר חלון הקשר של 16k בלבד.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל עבר אופטימיזציה מכוונת לקוריאנית ולאנגלית בלבד, ואימון ה־RLHF שלו התמקד ביכולות שפה מקומיות. הוא לא יניב תוצאות שמישות בעברית.

אפשר להריץ אותו ישירות מתוך vLLM הרשמי?

לא בצורה חלקה נכון לעדכון האחרון. NAVER פרסמו ענף נפרד משלהם של vLLM לתמיכה במודל, כך שתצטרכו לקמפל ולהריץ את הגרסה מהמאגר שלהם.

איך מריצים

במשקל כולל של כ־14 גיגה־בייט בדיוק bfloat16, אפשר להריץ אותו מקומית על כרטיס מסך צרכני בודד עם 16 או 24 גיגה־בייט זיכרון. תצטרכו להתקין תלויות כמו einops, timm, decord ו־av כדי לטפל במדיה לפני שהיא מגיעה למודל.

בשביל ביצועים נורמליים בייצור, NAVER שחררו ענף ייעודי מותאם של vLLM במאגר הגיטהאב שלהם. אם אתם לא צריכים ניתוח וידאו בקוריאנית, עדיף לפנות ל־API מסחרי סטנדרטי במקום לתחזק גרסת מנוע מותאמת אישית של vLLM עבור מודל בודד.

from transformers import pipeline

pipe = pipeline("text-generation", model="naver-hyperclovax/HyperCLOVAX-SEED-Vision-Instruct-3B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ללא פירוט חופשי מוכר כמו MIT או אפאצ'י. במצב כזה אי אפשר להניח שמותר להשתמש בו במוצר מסחרי, וכל שילוב באפליקציה מחייב בדיקה של תנאי השימוש המשפטיים שמצורפים למאגר של NAVER לפני שכותבים שורת קוד אחת.

הרישיון המלא בעמוד המודל ↗