GPT
S

Skywork-R1V-38B

קוד פתוח

Skyworkmit2025-03-17

  • transformers
  • safetensors
  • skywork_chat
  • image-text-to-text
  • conversational

חיבור ישיר בין מודל שפה של DeepSeek למקודד תמונה כדי לפתור שאלות ויזואליות מורכבות. הוא נותן יכולות הסקה וחישוב שמתחרות במודלים ענקיים, במשקל של מודל בינוני.

  • 38Bפרמטרים
  • 71.5 GBמשקל הקבצים
  • 14,942הורדות בחודש
  • 128לייקים

מה זה

הארכיטקטורה כאן מחברת שני רכיבים מוכרים. הבסיס הטקסטואלי נשען על DeepSeek-R1-Distill-Qwen-32B, ואת קליטת התמונות מבצע InternViT-6B-448px-V2_5. החיבור הזה מייצר מודל ויזואלי שמסוגל לייצר שרשרת חשיבה מלאה עבור תמונות, ולא רק לפלוט תיאור שטחי או תשובה קצרה.

במבחני ביצועים רואים היטב את ההשפעה של מודל ההסקה. במבחן AIME 2024 הוא מגיע לציון של 72.0, שמשאיר מאחור מודלים סגורים כמו GPT-4o שעומד על 9.3 או Claude 3.5 Sonnet עם 16.0. במבחני הבנה ויזואלית כללית כמו MMMU הוא משיג 69.0, שזה קרוב מאוד למודלים גדולים בהרבה כמו Qwen2.5-VL-72B שקיבל 70.2, אם כי ב־MathVista הוא נעצר ב־67.5 ומפגר אחרי מודלי 70B ייעודיים.

מתאים ל

  • פתרון בעיות מתמטיות מתמונה

    השילוב של מנוע R1 נותן תוצאה של 94.0 במבחן MATH-500, מתאים לניתוח שרטוטים ומשוואות.

  • פענוח תרשימים מדעיים

    ציון 69.0 ב־MMMU מאפשר ניתוח מעמיק של גרפים מורכבים ואיורים רפואיים.

  • הסקה ויזואלית מרובת שלבים

    שרשרת החשיבה מפרקת בעיה גדולה בתמונה לסדרת צעדים לוגיים ברורים.

איפה זה נופל

למרות החוזק במתמטיקה, המודל אינו מוביל בכל מבחן ויזואלי. ב־MathVista הוא קיבל 67.5, נמוך מ־InternVL-2.5-38B שהגיע ל־71.9 באותו סדר גודל. בנוסף, הכרטיס לא כולל מידע על תמיכה בשפות שאינן אנגלית, אין פירוט לגבי התמודדות עם טקסט בעברית, ואין שום בדיקות בטיחות או עמידות בפני הטיות בתיעוד הרשמי.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב מקומי יחיד?

לא על מחשב רגיל. המשקלים תופסים מעל 70 גיגה־בייט בדיוק המקורי, ולכן נדרשת תחנת עבודה עם כמה כרטיסים גרפיים מקצועיים או שרת ייעודי בענן.

מה ההבדל בין המודל הזה לגרסת R1V2?

ההבדל נמצא במודל השפה. הגרסה הזו משתמשת ב־DeepSeek-R1 מזוקק, בעוד גרסת R1V2 מבוססת על מודל QwQ-32B של עליבאבא.

איך מריצים

כדי להריץ את המודל בדיוק המקורי של bfloat16 תצטרכו לפחות 80 גיגה־בייט של זיכרון וידאו, מה שאומר בדרך כלל שני כרטיסי A100 או H100 של 80GB, או מערך מרובה כרטיסים צנועים יותר אם אתם משתמשים בחלוקה בין כרטיסים. הקוד בתיעוד מציג במפורש שימוש בשני כרטיסים נפרדים דרך transformers כדי לטעון את כל המשקלים.

יש למשפחה הזו גם גרסה שנייה בשם Skywork-R1V2-38B, שמחליפה את מנוע השפה ב־QwQ-32B. אם אין לכם גישה לשרת ייעודי בענן עם חומרה מתאימה, ההרצה העצמאית תהיה יקרה וכבדה מדי, ובמקרים כאלה עדיף לחכות לנקודות קצה מוכנות ב־API מסחרי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Skywork/Skywork-R1V-38B")
print(pipe("שלום"))

הרישיון

הפרויקט מפורסם תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי קוד והפצה, בלי דרישה לפתוח את הקוד שלכם, ובלבד שתשמרו על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗