GPT
O

Octen-Embedding-0.6B

קוד פתוח

Octenapache-2.02026-01-10

  • sentence-transformers
  • safetensors
  • qwen3
  • sentence-similarity
  • feature-extraction

מודל וקטורי קל משקל שמציע חלון הקשר ענק של 32,768 טוקנים. הוא מיועד למי שצריך לחפש בתוך מסמכים ארוכים ישירות על מכונות פשוטות בלי לשלם לפי קריאה.

  • 596Mפרמטרים
  • 32,768טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 24,553הורדות בחודש

מה זה

מדובר במודל הטמעות קטן של 596 מיליון פרמטרים, שעבר אימון LoRA על בסיס Qwen3 ומחזיר וקטורים בגודל 1024 ממדים. השילוב בין גודל זעיר לתמיכה במסמכים באורך של עד 32 אלף טוקנים הוא הנקודה המרכזית פה, במיוחד כשרוב המודלים בגדלים האלה נחנקים אחרי כמה אלפי טוקנים בודדים.

בטבלת RTEB הציבורית הוא קיבל ציון 0.7241, שזה מעל מודלים קנייניים כבדים כמו voyage-3.5 או text-embedding-3-large של OpenAI במבחן הזה. עם זאת, התוצאות שלו במבחנים הפרטיים לא פורסמו בכרטיס, בשונה מאחיו הגדולים בסדרה, כך שקשה לדעת כמה טוב הוא באמת מתמודד עם נתונים שלא ראה כלל.

מתאים ל

  • חיפוש בקוד ומסדי נתונים

    הוא אומן על שאילתות SQL וחיפוש קוד, ומתאים למערכות שרצות ישירות בסביבת הפיתוח.

  • שליפת מסמכים רפואיים

    חלון של 32K טוקנים קולט תיקים קליניים ודיאלוגים ארוכים בלי צורך לחתוך אותם למקטעים קטנים.

  • אינדוקס דוחות פיננסיים

    מספק התמחות מובנית במונחי כספים ומאפשר הרצה מקומית מאובטחת על חומרה פשוטה.

איפה זה נופל

היוצרים מודים שהביצועים משתנים מאוד בין שפות ותחומים, ושמעבר ל־32 אלף טוקנים הטקסט פשוט ייחתך. החיסרון הבולט הוא היעדר נתונים על עברית. המודל מתמקד באנגלית ובסינית לצד תמיכה רב־לשונית כללית, אבל בלי בדיקה יזומה של חיפוש סמנטי בעברית אי אפשר לסמוך עליו במערכת מקומית. בנוסף, חסר לו ציון במבחן הפרטי של RTEB, מה שמשאיר סימן שאלה לגבי יכולת ההכללה האמיתית שלו בהשוואה לגרסת ה־8B.

אותה משפחה

Octen-Embedding יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי לבחור בו על פני גרסת ה־8B של אותה סדרה?

גרסת ה־8B מובילה את הטבלה ומציגה תוצאות עקביות גם במבחנים פרטיים, בעוד גרסת ה־0.6B מתאימה בעיקר כשיש מגבלת זיכרון חריפה או צורך להריץ על מעבד. אם הדיוק הוא השיקול היחיד ויש לכם שרת GPU מתאים, הגרסה הגדולה עדיפה.

איך המודל מתמודד עם טקסטים קצרים?

הוא עובד כרגיל ומייצר וקטור של 1024 ממדים עבור כל קלט, אבל היתרון שלו מול מודלים קטנים אחרים בא לידי ביטוי בעיקר כשמנצלים את ההקשר הארוך. לטקסטים של משפט בודד קיימות חלופות זעירות שלא נבנו מראש עבור חלונות ענק.

איך מריצים

בזכות משקל של 1.1 גיגה בייט בלבד, מריצים אותו ישירות עם ספריית sentence-transformers או דרך transformers הרגילה של פייתון. הוא לא דורש שרתי GPU יקרים, וכרטיס מסך בסיסי או אפילו מעבד מודרני יספיקו כדי להריץ אותו מקומית או בקצה.

הבחירה בו מול שירות חיצוני מנוהל תלויה בעיקר באורך הטקסטים. אם אתם מעבדים מסמכים ארוכים של עשרות אלפי טוקנים, תשלום לפי טוקן ב־API חיצוני מצטבר מהר מאוד, וכאן הרצה עצמית על חומרה זולה חוסכת עלויות באופן מיידי.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Octen/Octen-Embedding-0.6B")
v = m.encode(["שלום עולם"])

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים והפצה בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי תמלוגים או הגבלות שימוש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗