GPT
Q

Qwen3-ASR-Demo

רץ בדפדפן

Qwenapache-2.02025-09-08

  • gradio

יש כאן גם סקירה על Qwen עצמו.

הדגמה שממירה הקלטות קוליות לטקסט כתוב ומתאימה למי שרוצה לבדוק זיהוי דיבור עם מונחים מותאמים אישית. מזינים קובץ שמע ומקבלים תמלול לצד זיהוי השפה.

  • הורדות בחודש
  • 263לייקים

מה זה

מעלים קובץ קול או מקליטים ישירות דרך הדפדפן, ומקבלים את התמלול המלא בחלון הטקסט. אם בוחרים בזיהוי שפה אוטומטי, מקבלים בנפרד גם את השפה שזוהתה בהקלטה. הממשק כולל שדה טקסט חופשי שבו אפשר להזין הקשר או מונחים מיוחדים כדי לשפר את הדיוק, וכן תיבת סימון להפעלת נרמול טקסט שממיר מספרים וביטויים לצורה כתובה תקנית.

מאחורי הקלעים הקוד פונה אל ספריית dashscope של עליבאבא ומשתמש במודל MultiModalConversation, כך שהעיבוד האמיתי קורה דרך שירות חיצוני. הדוגמאות המוכנות שמגיעות עם העמוד מציגות התמודדות עם תיאור משחק שמכיל שמות ומונחים מקצועיים, זיהוי אנגלית על רקע רעש, ותמלול דיאלקטים בתנאי רעש כבדים.

מתאים ל

  • בדיקת שמות ומונחים מקצועיים

    מזינים מראש מושגים נדירים בשדה ההקשר ובודקים אם התמלול מזהה אותם נכון מתוך הדיבור.

  • בדיקת עמידות ברעשי רקע

    מעלים הקלטה באיכות נמוכה או עם רעש סביבתי כדי לראות אם הטקסט יוצא קריא ומדויק.

  • זיהוי שפה אוטומטי בהקלטה

    מריצים קובץ קול שבו השפה לא מוגדרת מראש כדי לקבל את השפה המזוהה יחד עם התמלול.

איפה זה נופל

ההדגמה לא מריצה מודל מקומי על השרת אלא שולחת את המידע ל־API של dashscope, כך שהיא לא משקפת ביצועי הרצה עצמאית על חומרה משלכם. בנוסף, חסר כאן תיעוד לגבי מגבלת גודל הקובץ או משך השמע המותר, ואין מידע אם עברית נתמכת ברשימת השפות של המודל.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, הגישה לממשק דרך הדפדפן היא בחינם ופתוחה לכל מי שנכנס לעמוד. אין צורך להכניס כרטיס אשראי או מפתח גישה אישי כדי להריץ בדיקות. אתם פשוט מעלים את הקובץ ומקבלים תוצאה.

מה קורה עם קובצי הקול שאני מעלה?

הקובץ מועבר דרך הממשק ונשלח לספריית dashscope שמעבדת אותו בשרתי השירות. אם מדובר בהקלטות רגישות, פרטיות או עסקיות, מוטב לא להעלות אותן כאן. המידע עובר לספק צד שלישי לצורך התמלול.

במה ההדגמה הזאת שונה מהרצת המודל עצמו?

העמוד משמש רק ממשק גרפי שנשען על שיחות API מול שרתי עליבאבא. הוא לא מריץ את המשקולות של המודל על השרת המקומי של הדף. מי שרוצה ביצועים זהים אצלו יצטרך לחבר את ה־API או להוריד מודל תואם לסביבה שלו.

כמה זמן לוקח לתמלל הקלטה?

העיבוד מתחיל מיד אחרי שלוחצים על כפתור ההפעלה, אך תלוי ברשת ובאורך הקובץ. מאחר שהקוד רק מעביר את הבקשה לשירות מרוחק ולא מעבד אותה על ה־CPU המקומי, התשובה חוזרת לרוב בתוך שניות בודדות בהקלטות קצרות.

איך משתמשים

לוחצים על העלאת שמע או בוחרים באחת הדוגמאות המוכנות, מוסיפים הקשר ומסמנים נרמול טקסט אם רוצים, ולוחצים על כפתור תחילת הזיהוי. הממשק רץ על מעבד בסיסי, אבל מאחר שהחישוב בפועל נשלח דרך ה־API של dashscope, זמן ההמתנה תלוי בעיקר בתקשורת מול השרתים של עליבאבא ובאורך הקובץ שהעליתם.

הרישיון

הפרויקט מפורסם ברישיון apache-2.0, שמאפשר שימוש חופשי בקוד המקור. עם זאת, קובצי הקול והתמלילים נשלחים ומעובדים דרך שירות dashscope, ולכן כדאי לקחת בחשבון שאין ערובה לפרטיות מוחלטת של ההקלטות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗