GPT
R

reka-edge-2603

קוד פתוח

RekaAIother2026-03-11

  • transformers
  • safetensors
  • yasa2
  • image-text-to-text
  • conversational

מודל מולטימודלי של 7 מיליארד פרמטרים שרץ מקומית על וידאו ותמונות. הוא דוחס תמונות לשליש מכמות הטוקנים המקובלת ומגיב מהר מאוד.

  • 7.1Bפרמטרים
  • 16,384טוקנים בהקשר
  • 13.3 GBמשקל הקבצים
  • 420הורדות בחודש

מה זה

מדובר במודל שמקבל תמונות, וידאו וטקסט ומחזיר טקסט. היתרון המרכזי שלו מול מודלים בגודל דומה הוא היעילות בייצוג ויזואלי. תמונת ברירת מחדל של 1024 על 1024 תופסת אצלו 331 טוקנים בלבד, לעומת מעל 1,000 טוקנים במודלים מתחרים. הדחיסה הזו מורידה את זמני התגובה לחצי ואפילו לפחות מזה.

במבחני הבנה של וידאו כמו MLVU הוא עוקף משמעותית מתחרים בקטגוריית 8 ו־9 מיליארד פרמטרים. הוא תומך גם בזיהוי אובייקטים לפי הנחיה מילולית ובהפעלת כלים. המטרה כאן היא לתת מענה למשימות ראייה ממוחשבת מורכבות על חומרה מקומית בלי לטחון זיכרון על טוקנים מיותרים.

מתאים ל

  • ניתוח וידאו במכשירי קצה

    צריכת טוקנים נמוכה מאפשרת עיבוד פריימים רציף בלי להעמיס על זיכרון המכשיר.

  • זיהוי אובייקטים מתמונות

    מאתר חפצים ואנשים על בסיס הנחיה טקסטואלית ישירה בתוך התמונה.

  • אוטומציה בממשקי מובייל

    משיג דיוק גבוה בבדיקות של הפעלת כלים וזיהוי רכיבי מסך.

איפה זה נופל

הכרטיס מציין במפורש שהמודל לא תומך ביכולות חשיבה ושרשרת מחשבה, ולכן מריצים אותו עם ביטול מפורש של רכיב ה־reasoning. במבחני הזיות וידאו הוא קיבל ציון נמוך יחסית, כך שהוא נוטה להמציא פרטים כשמבקשים ממנו לנתח סרטונים מורכבים. בנוסף, חלון ההקשר מוגבל ל־16,384 טוקנים, והרצה שלו ב־transformers מחייבת גרסה מדויקת ונעולה של הספרייה כדי לא להישבר.

שאלות
נפוצות

אפשר להריץ אותו ישר דרך transformers רגיל?

כן, אבל חייבים להשתמש בגרסת transformers 4.57.3 ספציפית ולאשר הרצת קוד מרוחק בגלל ארכיטקטורה מותאמת אישית.

איך המודל מתמודד עם וידאו ארוך?

חלון ההקשר מוגבל לכ־16 אלף טוקנים, ולכן הוא מתאים לקטעי וידאו קצרים ולא להזנה של שעות הקלטה רצופות.

איך מריצים

כדי להריץ אותו בפורמט המקורי בלי קוונטיזציה תצטרכו 24 גיגה זיכרון GPU או זיכרון אחוד במק, כשההמלצה הרשמית עומדת על 32 גיגה. הוא רץ דרך תוסף ייעודי ל־vLLM שמטפל בארכיטקטורה הייחודית שלו, או דרך llama.cpp אחרי המרה ל־GGUF, שם אפשר לכווץ אותו ולדחוף למכשירי קצה וטלפונים.

אם אתם רק צריכים מענה מדי פעם לתמונות בודדות בלי דרישת פרטיות מחמירה, ה־API של המפתחת יחסוך את כאב הראש של תלויות הליבה והפלאגינים הנדרשים להרצה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="RekaAI/reka-edge-2603")
print(pipe("שלום"))

הרישיון

הרישיון פתוח למחקר ולשימוש מסחרי, אבל יש בו הגבלת הכנסות ברורה. מותר להשתמש בו במוצר מסחרי רק אם ההכנסות שלכם נמוכות ממיליון דולר בשנה. אם עברתם את הרף הזה, אתם חייבים לקבל אישור מיוחד מהחברה.

הרישיון המלא בעמוד המודל ↗