GPT
A

Arch-Router-1.5B

קוד פתוח

katanemoother2025-05-30

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • routing

הכלי הזה מנתב שאילתות בין מודלים שונים כדי לחסוך עלויות וזמן תגובה. הוא נבנה כרכיב תשתיתי קל משקל שקובע איזה מודל הכי מתאים לכל משימה.

  • 1.5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 2.9 GBמשקל הקבצים
  • 1,688הורדות בחודש

מה זה

במקום לענות ישירות על שאלות של משתמשים, המודל הזה סורק את הבקשה ומחליט איזה מודל אחר צריך לטפל בה. הוא מבוסס על ארכיטקטורת Qwen2 בגודל של 1.5 מיליארד פרמטרים, וממפה את השאילתה לשני משתנים: התחום הכללי כמו תכנות או רפואה, והפעולה המבוקשת כמו תמצות או כתיבת קוד.

היוצרים שלו טוענים שבמבחני התאמה להעדפות אנושיות בשיחות הוא עוקף מודלים קנייניים מובילים. המשמעות בפועל היא שהוא יודע להחזיר תשובה במבנה מוגדר, בדרך כלל מחרוזת JSON פשוטה, שמאפשרת לשלב אותו כנתב תנועה בארכיטקטורת סוכנים או מול שער כניסה למודלים מרובים, בלי להמציא מנגנוני סיווג מאפס.

מתאים ל

  • פרוקסי חכם למודלים

    הוא מנתב בקשות מורכבות למודל יקר ושאילתות פשוטות למודל זול כדי לחתוך עלויות API.

  • סיווג כוונות בסוכנים

    זיהוי הפעולה והתחום של המשתמש והעברת המשימה לכלי הייעודי המתאים במערכת.

  • אבטחת איכות בקשות

    בדיקה ראשונית של תוכן השאילתה באנגלית ומיון שלה לפני שהיא פוגשת מודל ייצור כבד.

איפה זה נופל

המודל מוגדר עבור השפה האנגלית בלבד, כך שאם המשתמשים שלכם כותבים בעברית, הסיווג עלול להישבר לחלוטין או לפספס הקשרים קריטיים. בנוסף, הוא תלוי לחלוטין בתבנית הפרומפט הספציפית שהיוצרים שלו הגדירו, וכל חריגה ממנה תפגע ביכולת שלו להחזיר JSON תקין. הוא לא מחליף מודל שפה כללי אלא יודע רק להחליט על ניתוב, ולא הייתי מכניס אותו למערכת מבלי לוודא קודם שהוא מזהה נכון את התחומים העסקיים הייחודיים שלכם.

שאלות
נפוצות

האם אפשר להשתמש בו לשיחות או לכתיבת טקסט רגיל?

לא, המודל אומן באופן ממוקד להחזיר החלטות ניתוב וקטגוריות ולא לנהל שיחה חופשית. הוא מצפה לפרומפט בתבנית מוגדרת ומחזיר מבנה JSON עם יעד הניתוב, כך שהוא לא יעזור כמנוע צ'אט.

איך הוא יתמודד עם שאילתות בעברית?

הוא מתועד לשפה האנגלית בלבד. סביר להניח ששאילתה בעברית תגרום לו לפספס את הפעולה או לסווג לקטגוריה הלא נכונה, ולכן תצטרכו לתרגם את הבקשה לאנגלית לפני הניתוב או לבחור מודל אחר.

איך מריצים

המשקל הכולל של הקבצים הוא 2.9 גיגה בייט בדיוק של float16, כך שאפשר להריץ אותו בקלות על כרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון, או אפילו ישירות על מעבד סביר בלי לחנוק את המערכת. כל מה שצריך זה סביבת פייתון פשוטה עם ספריית transformers מגרסה 4.37.0 ומעלה.

אם אתם עובדים עם שרת פרוקסי קיים או שאין לכם תשתית הרצה עצמאית, עדיף להשתמש בפתרון מנוהל כדי לא לתחזק שרת נוסף רק בשביל החלטות ניתוב. המודל הזה שווה את הטרחה רק כשאתם מעבירים נפח תנועה גדול ורוצים אפס תלות בשירותים חיצוניים בשלב הסיווג.

from transformers import pipeline

pipe = pipeline("text-generation", model="katanemo/Arch-Router-1.5B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כמותאם אישית תחת השם Katanemo license ולא תחת רישיון קוד פתוח סטנדרטי כמו MIT או Apache. המשמעות היא שחובה לקרוא את קובץ הרישיון המקורי במאגר לפני שמפיצים אותו או משלבים אותו במוצר מסחרי, כי ייתכנו הגבלות שימוש, דרישות ייחוס או תנאים מסחריים מיוחדים.

הרישיון המלא בעמוד המודל ↗