GPT
K

kanana-1.5-v-3b-instruct

קוד פתוח

kakaocorpother2025-07-23

  • transformers
  • safetensors
  • kanana-1.5-v
  • feature-extraction
  • image-text-to-text

מודל ראייה ושפה קומפקטי של 3.7 מיליארד פרמטרים שמתמחה בקוריאנית ובאנגלית. הוא מציע יכולות מעקב אחר הוראות ופענוח מסמכים שמתחרות ישירות במודלים מקבילים בקטגוריית המשקל שלו.

  • 3.7Bפרמטרים
  • 32,768טוקנים בהקשר
  • 6.8 GBמשקל הקבצים
  • 30,649הורדות בחודש

מה זה

מדובר במודל רב מודלי של חברת Kakao שמחבר מקודד תמונה, רכיב C-abstractor ומודל שפה של 3.7 מיליארד פרמטרים. התפקיד שלו הוא לקבל תמונות וטקסט ולהחזיר תשובות טקסטואליות בלבד. הדגש המרכזי כאן הוא שילוב דו לשוני חזק מאוד בין אנגלית לקוריאנית, עם חלון הקשר של 32,768 טוקנים שמתאים לעיבוד מסמכים ארוכים.

במבחני הביצועים מול דגמים כמו Qwen2.5-VL-3B ו־InternVL2.5-4B, המודל מציג תוצאות דומות מאוד באנגלית, למשל 74.00 בממוצע תמונה כולל 93.06 ב־DocVQA ו־82.50 ב־OCRBench. היתרון הבולט שלו מופיע במבחנים בקוריאנית עם ממוצע של 68.27 לעומת 60.60 של המתחרה מבית Qwen, וציון של 77.39 במעקב אחר הוראות רב מודליות, תחום שבו המתחרים נשארים סביב ה־55.

מתאים ל

  • חילוץ נתונים ממסמכים

    קריאה של חשבוניות וטפסים באנגלית וקוריאנית בזכות דיוק של 93.06 במבחן DocVQA.

  • הסבר תרשימים וגרפים

    ניתוח ויזואלי של גרפים עם ציון 81.20 ב־ChartQA וחלון הקשר שמאפשר לצרף הקשר ארוך.

  • מערכות דיאלוג על תמונות

    ציון 77.39 במעקב אחר הוראות מורכבות סביב תמונה הופך אותו לבסיס טוב לעוזרים אינטראקטיביים.

איפה זה נופל

היוצרים מבהירים במפורש שהמודל נוטה להזיות ולתוכן לא מדויק בנושאים מדעיים מורכבים או בחישובים מתמטיים. ציוני ה־MMMU שלו, 43.89 בלבד, וציון של 36.88 במבחן KoMathSolution מעידים על קושי ממשי כשמדובר בניתוח תרשימים מדעיים ומספרים. מעבר לכך, ביצועי המודל בשפות שאינן קוריאנית או אנגלית לא נבדקו כלל וצפויים להיות ירודים, כך שעבור טקסטים או מסמכים בעברית הוא פשוט לא מיועד.

שאלות
נפוצות

האם המודל מסוגל לקרוא מסמכים ותמונות עם כיתוב בעברית?

לא כדאי להסתמך עליו למטרה הזו. המודל אומן ונבדק רק באנגלית ובקוריאנית, והיוצרים מציינים שביצועיו בשפות אחרות לא נבדקו ועלולים להיות ירודים.

איזה כרטיס מסך נדרש כדי להריץ אותו מקומית?

במשקל של 6.8 גיגה בייט בדיוק bfloat16, כרטיס מסך עם 12 עד 16 גיגה זיכרון VRAM יספיק לטעינה ולהרצה חלקה של תמונות יחד עם טקסט.

איך מריצים

כדי להריץ אותו צריך התקנה סטנדרטית של transformers בגרסה 4.45 ומעלה, יחד עם הספריות accelerate, timm ו־omegaconf. המודל שוקל 6.8 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך ביתי בודד עם 12 או 16 גיגה זיכרון VRAM מחזיק אותו בקלות לביצוע הסקת מסקנות, גם כשטוענים תמונות כבדות.

אם אין לכם שרת עם מאיץ גרפי מתאים וזמין, עדיף להשתמש ב־API מנוהל של מודל ראייה גדול. להחזיק תשתית ייעודית עבור המודל הזה משתלם בעיקר אם אתם מחפשים עיבוד מקומי מטעמי פרטיות או נדרשים למהירות תגובה קבועה במערכות פנימיות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="kakaocorp/kanana-1.5-v-3b-instruct")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון קנייני מותאם אישית שנקרא kanana-license וסווג ברישום כ־other. לא מצורף בעמוד נוסח הרישיון המלא, ולכן לא ידוע אם מותר להשתמש בו במוצר מסחרי או אילו מגבלות הפצה חלות עליו. חברות שרוצות לשלב אותו במערכות ייצור חייבות לפנות לכתובת השותפויות של Kakao כדי להסדיר את תנאי השימוש החוקיים.

הרישיון המלא בעמוד המודל ↗