GPT
R

R-4B

קוד פתוח

YannQiapache-2.02025-08-11

  • transformers
  • safetensors
  • R
  • feature-extraction
  • image-text-to-text

מודל ראייה ושפה קומפקטי שמחליט לבד מתי לעצור לחשוב ומתי לענות מיד. החידוש כאן הוא שליטה ידנית או אוטומטית בעומק החשיבה בלי לבזבז משאבים על שאלות פשוטות.

  • 4.8Bפרמטרים
  • 40,960טוקנים בהקשר
  • 9.0 GBמשקל הקבצים
  • 16,090הורדות בחודש

מה זה

מדובר במודל מולטימודלי שמיועד לעיבוד משולב של תמונה וטקסט. הוא נבנה כדי לפתור את בעיית היעילות במודלים שחושבים צעד אחר צעד, תהליך שלרוב שואב המון טוקנים גם כשמדובר במשימות זיהוי בסיסיות. במקום לכפות שרשרת חשיבה ארוכה על כל קלט, הוא יודע לנתח את מורכבות השאלה ולבחור בין מענה ישיר לבין הסקה לוגית מעמיקה.

היתרון שלו בולט במבחני חשיבה כמותית ולוגית כמו WeMath, MathVerse ו־LogicVista. במבחנים האלה הוא מפגין יכולת ניתוח שמקבילה למודלים כבדים בהרבה. בנוסף, הוא התברג במקום הראשון בדירוג OpenCompass למודלים מולטימודליים מתחת ל־20 מיליארד פרמטרים, הישג מרשים למשקל נוצה כזה.

מתאים ל

  • פתרון בעיות מתמטיות מתמונה

    מצב החשיבה הארוך מאפשר לו לפרק משוואות ותרשימים הנדסיים מורכבים בצעדים מדויקים.

  • תיוג תמונות מהיר וזול

    במצב short הוא מדלג על שלבי ההסקה, עונה מיד וחוסך זמן עיבוד יקר.

  • עוזר מחקר לתרשימים וגרפים

    מצב auto מזהה שאלות נתונים מורכבות ומפעיל חשיבה עמוקה רק כשצריך לחלץ תובנות.

איפה זה נופל

המודל מוגדר רשמית רק באנגלית, כך שהוא לא מתאים לעיבוד טקסט או תמונות עם כיתוב בעברית. בנוסף, חלון ההקשר שלו מוגבל יחסית ביחס לדגמים חדישים אחרים, ועומד על קצת יותר מארבעים אלף טוקנים. השימוש ב־vLLM מחייב הישענות על גרסת פיתוח מקומית והפעלת קוד חיצוני עם trust_remote_code, מה שיוצר סיכון אבטחתי ומקשה על שילוב יציב בסביבות ייצור מוקשחות.

שאלות
נפוצות

האם המודל מבין עברית?

הכרטיס מציין תמיכה בשפה האנגלית בלבד. לא כדאי להסתמך עליו לפענוח מסמכים או תמונות המכילות טקסט בעברית.

איך שולטים על משך זמן התגובה שלו?

מעבירים את הפרמטר thinking_mode בבקשה. בחירה ב־short מחזירה תשובה מיידית, long מפעיל חשיבה מפורטת, ו־auto מאפשר למודל להחליט לבד לפי מורכבות הקלט.

איך מריצים

אתם מריצים אותו דרך transformers או בסביבת vLLM בגרסה העדכנית ביותר, שדורשת התקנה ישירות מקוד המקור. הקבצים שוקלים תשעה ג'יגה בייט בדיוק float32, כך שכרטיס מסך ביתי מודרני עם שמונה עד שישה עשר ג'יגה זיכרון יספיק להרצה מקומית. דוגמת ההרצה הרשמית של vLLM מציגה חלוקה על פני שמונה מעבדים גרפיים, אך לגודל כזה זו דרישה רלוונטית בעיקר לעומסי עבודה כבדים בשרת ייעודי.

בעת הפנייה אפשר להגדיר thinking_mode לערכים auto, long או short. אם אתם צריכים רק תיוג תמונות פשוט בקצב נמוך, כנראה שפנייה לשירות ענן מוכן תחסוך לכם תחזוקת שרת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="YannQi/R-4B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מעניק חופש מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור או פתוח. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗