GPT
Q

Qwen3-Embedding-0.6B-ONNX

קוד פתוח

onnx-communityרישיון לא דווח2025-06-05

  • transformers.js
  • onnx
  • qwen3
  • feature-extraction

גרסת ONNX קומפקטית שמייצרת וקטורים ישירות בסביבות ג'אווהסקריפט. היא נותנת חלון עבודה עצום של 32,768 טוקנים בלי צורך בשרתי פייתון כבדים.

  • 32,768טוקנים בהקשר
  • 7.3 GBמשקל הקבצים
  • 20,298הורדות בחודש
  • 42לייקים

מה זה

מדובר בהמרה של מודל וקטורי מבית Qwen שנועדה לעבוד עם הספרייה transformers.js. המטרה כאן היא חילוץ מאפיינים וייצוג טקסט במבנה מתמטי, כשהייחוד הבולט הוא היכולת לבלוע מסמכים ארוכים מאוד בבת אחת בזכות תמיכה בעשרות אלפי טוקנים.

המשקל של 0.6B פרמטרים מציב אותו בצד הקל של מודלי שפה מודרניים, אבל הוא רץ על ארכיטקטורה של 28 שכבות בדיוק bfloat16. במקום להקים שרת ייעודי רק בשביל להוציא אמבדינגס, אפשר לשלב אותו ישירות בסביבות ווב או בסקריפטים של Node.js, מה שחוסך קריאות רשת ומפשט את התשתית שלכם לחלוטין.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    הוא מטפל בעד 32,768 טוקנים בלי שתצטרכו לקצוץ את המקור למקטעים זעירים.

  • הטמעת וקטורים בסביבת ווב

    התאמה מלאה ל־transformers.js מאפשרת לחלץ מאפיינים ישירות מסקריפטים בג'אווהסקריפט.

  • שמירה על פרטיות מקומית

    החישוב מתבצע כולו אצלכם על החומרה המקומית בלי להוציא נתונים לשירותי ענן חיצוניים.

איפה זה נופל

הבעיה המרכזית היא חוסר ודאות מוחלט לגבי איכות התוצאות, כי כרטיס המודל לא כולל שום מבחני ביצועים, בנצ'מרקים או פירוט לגבי שפות נתמכות. בנוסף, חלוקת המשקלים ל־21 קבצים בנפח של 7.3 GB יוצרת סרבול בהורדה, ודורשת בדיקה מעמיקה של זמני הטעינה והתנהגות הטוקנייזר לפני שסומכים עליו.

שאלות
נפוצות

אפשר להריץ אותו ישירות בדפדפן של המשתמש?

הוא נבנה עבור transformers.js ולכן טכנית זה אפשרי, אבל נפח כולל של 7.3 GB יחנוק חיבורי אינטרנט ביתיים וזיכרון של מכשירים ניידים. עדיף להריץ אותו ב־Node.js בצד השרת.

מותר להכניס אותו לקוד של מוצר מסחרי?

כרגע אין רישיון מוצהר במאגר, ולכן אין אישור חוקי לעשות בו שימוש מסחרי. חובה לאתר קודם את תנאי הרישוי של מודל המקור שעליו הוא מבוסס.

איך מריצים

אתם מתקינים את חבילת transformers מ־NPM וטוענים את המשקלים ישירות בקוד שלכם. סך כל הקבצים שוקל 7.3 GB שמחולקים בין 21 קבצים שונים, כך שתצטרכו מספיק זיכרון עבודה פנוי ומקום בדיסק כדי לטעון אותם כמו שצריך.

אם היישום שלכם רץ אצל משתמשי קצה עם מכשירים חלשים, המשקל הזה יכביד עליהם מאוד. במצב כזה, עדיף להעביר את החישוב לשרת Node.js פנימי או להשתמש ב־API מרוחק במקום לגרור את כל הקבצים לצד הלקוח.

pip install -U huggingface_hub
hf download onnx-community/Qwen3-Embedding-0.6B-ONNX

הרישיון

הרישיון לא דווח בעמוד המודל. מבחינת מי שבונה מוצר מסחרי, מדובר בסיכון משפטי ברור כי אין שום היתר שימוש מפורש. אסור להפיץ אותו בקוד מסחרי לפני שבודקים את תנאי המקור של המודל המקורי.

הרישיון המלא בעמוד המודל ↗