Voice Recognition – מערכת זיהוי קולי בעברית – מי מוביל בתחום?

זיהוי קולי בענן

מערכת זיהוי קולי Voice Recognition - טכנולוגיית Voice Recognition מצויה בכל פינה ומסייעת לארגונים להחליף את העובדים האנושיים במרכזיות טלפון

9 דקות קריאה · עודכן ספטמבר 2026
דברו עם מהנדס בוואטסאפ
או חייגו077-8123111
במדריך זה

Voice Recognition


✅ טכנולוגיית זיהוי קולי
Voice Recognition מסייעת לארגונים להחליף את העובדים האנושיים במרכזיות ובמוקדי השירות המקיימות קשר אינטראקטיבי עם הפונים.

✅ כיצד בוחרים את מערכת הזיהוי הקולי לעסק וחוסכים בהוצאות התקשורת?

אינפוגרפיקה המתארת שימושים עקריים למערכת זיהוי קולי לעסקים

שוק הזיהוי הקולי (Voice Recognition) הוא אחד השווקים הנמצאים כיום בצמיחה מואצת, גם במגזר העסקי. טכנולוגיה זו, שלא הצליחה להתרומם במשך עשרות שנים (קיימת בשוק מעל ל- 50 שנה), קיבלה תנופה אדירה, כשחברת אפל הכניסה מערכת מתקדמת לזיהוי קולי בשם סירי (Siri).

מאז, סירי פועלת על כל האייפונים, האייפודים והאייפדים של אפל לסוגיהם. במקביל, המתחרים גם הם לא "שקטו על השמרים" והציגו מערכות מתקדמות מתחרות. למשל, מערכת Google Voice הוותיקה שודרגה למערכת המכונה בשמות דוגמת: S Voice או Google Now והוכנסה לכל הגרסאות של אנדרואיד מגרסה 4.0 ומעלה.

לאחרונה, החלה אינטל לשלב את מערכת זיהוי הדיבור של ניואנס בשם Dragon לתוך המחשבים החדשים לשוק הפרטי, בתוך מערכת החומרה כחלק מה- Chipset ובתמיכה בכל מערכת הפעלה המותקנת על המכשיר הנייד. זאת, על מחשבים ניידים מכל הסוגים החדשים דוגמת: אולטרבוקים, Phablets, סמארטפונים, טאבלטים, 2in1, All-In-One. להערכת אינטל, מסך המגע הוא כבר מיושן. להערכת אינטל, הקול הוא העתיד למגע בין המחשב והאדם. לדברי אינטל, האדם ישכח די מהר את המקלדת וגם את מסך המגע. להערכת, זה לא חזון לעתיד הרחוק. זה יבוא תוך זמן די קצר. השת"פ של אינטל עם חברת ניואנס מוביל לפיתוח שפה טבעית, שבה בני אדם ידברו עם המחשב שלהם. זה לא יהיה כמו הסירי (Siri של אפל), שמבין אנגלית במבטא מסוים. זה יהיה המגע החדש של האדם עם המחשב ולהערכת אינטל הם יתגברו די מהר על כל הקשיים הקיימים בתחום זה. להערכתם, אכן המחשב יבין את כל בני האדם, בכל שפה ובכל מבטא.

כך, השוק הפרטי הקדים בפיתוחים את השוק העסקי, בעולם זיהוי הדיבור.

יחד עם זאת, אסור לטעות בהבנת התחום. הוא נמצא עדיין בשלבי פיתוח (גם אחרי 50 שנה מהיום בו הוצג לראשונה לשוק ה- ICT). עדיין אין יכולת לזהות את כל השפות, כל המבטאים, להתגבר על רעשי רקע של הדובר ורעשים של קו הטלפון הנייח או הנייד, וכך הלאה. כל הנושאים הללו – טרם נפתרו. ב- IBM מעריכים, כי רק בעוד 15 שנה תחלפנה מערכות זיהוי קולי את העכבר והמקלדת. גם זה לא בטוח. עדיין לא הוכח, שניתן להשתמש בטכנולוגיות של זיהוי קולי ובדיבור כאמצעי קלט-פלט במחשבים ניידים ונייחים ובמערכות פתוחות.

לשיחה עם מהנדס טלקום אקספרטשיחת ייעוץ ללא התחייבות עם מהנדס, לא עם נציג מכירות. 077-812-3111
קבלו הצעת מחיר ממהנדס חיוג: 077-812-3111

לאילו מערכות מתאימה מערכת זיהוי דיבור Voice Recognition?

היא מתאימה לכל מקום בו ניתן להחליף מענה אנושי במענה ממוחשב, שמטפל במקבץ סגור של אפשרויות. ככל שכמות האפשרויות למענה וזיהוי הדיבור יותר מצומצמת, כך קטנה האפשרות לטעות בזיהוי ועולה רמת האפקטיביות של מתן השירות בצורה ממוחשבת ולא אנושית למתקשרים.

לכן, המערכות של זיהוי דיבור מצליחות במגזר העסקי כיום בכמה תחומים מאוד מצומצמים, ממוקדים וברורים:

א. לניתוב שיחות קולי במרכזיה לשלוחות של אנשים בארגון. במקרה זה מספר היעדים לניתוב השיחה ידוע ולכן הטעויות הן מינימליות.

ב. כתחליף ל- IVR הישן. גם במקרה זה, כמות התשובות ידועה ולכן מרווח הטעות בזיהוי די מצומצם.

ג. לאימות דובר במערכות פיננסיות. גם כאן, אם יש את "חתימת הקול" של האדם הפונה, קל לבצע אימות של קולו, מול "חתימת הקול" הקיימת כבר במערכת. זה סוג של "אימות ביומטרי", שמאוד מצליח במערכות הפיננסיות.

ד. ביצוע הזמנות או אישורים של רכישות, במקום שיש כמות קטנה של תפריטים ועץ ההחלטות ברור וסגור.

ה. תמיכה טכנית או אחרת במקום בו יש כמות ידועה וסגורה של אפשרויות לתמיכה.

ו. ביצוע פקודות קוליות במקום בו יש כמות ידועה וסגורה של אפשרויות לביצוע הפקודות, וקל להבחין בין הפקודות השונות של הדובר.

כיום טכנולוגיות זיהוי קולי נפוצות רק בשני תחומים – טלפונים סלולריים ומרכזי שירות לקוחות. הטכנולוגיה הצליחה לחדור דווקא לתחום המכשירים הסלולריים, מכיוון שהפעלת טלפון ללא מגע יכולה להציל חיים וחוסכת בזמן התפעול. הסיבה לחדירת טכנולוגיות לזיהוי הקולי למרכזי שירות הלקוחות היא הרצון לייעל את המערכת ולחסוך בכוח אדם אנושי יקר (יחסית).

החיסכון בעלויות למרכזי שירות הלקוחות הוא גדול וכך גם החזר ההשקעה. זאת, כי ניתוח דיבור מספק בסיס לאיזון בין שלושת היעדים העיקריים של מרכזי שירות לקוחות: שביעות רצון הלקוח מאיכות הפתרון המתקבל בפנייה הראשונה, התמודדות עם כמויות גדולות של שיחות, וייצור מכירות באמצעות המערכת הממוחשבת. דיוק של 85% עד 90% מספיק כדי להשיג את היעדים הללו.

בעתיד תהיינה מערכות, שתדענה לזהות ולהבין שאלות המופנות לנציגי מכירות הווירטואליים, ותשלופנה בהתאם ממאגר תשובות קודמות ומניתוח הפנייה את המידע הדרוש לטיפול בבעיות, ותוכלנה לתקשר באופן שוטף עם הלקוחות הפונים. המערכות הקיימות עדיין לא מצויות בנקודה הזו.

Voice Recognition

מיהם השחקנים המובילים בעולם בתחום Voice Recognition?  

המובילה עולמית היא ללא ספק ניואנס (Nuance), שהיא מעין "מונופול עולמי" בתחום זיהוי הדיבור, עם פתרונות המבוססים על רכישת כמה חברות הזנק ישראליות. רוב הפתרונות, שיש בשוק העולמי, מבוססים על מנועי זיהוי הדיבור של ניואנס. למעשה, החברות הגדולות בעולם כמו גם בישראל נמצאות בדילמה: האם לעבוד עם הפתרונות של ניואנס, שהיא מובילת שוק עולמית, או לפתח פתרונות לצרכים שלהם בעצמם. הדילמה הזו טרם נפתרה. חלק מהארגונים הגדולים מפתחים פתרונות עצמיים בקוד פתוח, כדי לא להיות תלויים בניואנס. למעשה, כל האינטגרטורים הגדולים בישראל פיתחו מערכות כאלו לצרכים ורטיקליים (למשל: לבנק מסוים), בגלל שמדובר בפרויקטים של מאות אלפי ועד מיליוני ₪.

המתחרה שנייה בגודלה בשוק העולמי היא IBM. בשוליים, יש מגוון עצום של חברות קטנות מתחרות, מתוכן ניתן לציין את חברת NSC מישראל (כיום חלק מ- AudioCodes), שיש לה מקום חשוב ובולט בשוק הזה. יש גם מספר לא קטן של חברות הזנק ישראליות צעירות הסבורות, שהן תצלחנה להקדים את ניואנס או IBM בפתרונות טובים יותר. למשל NovoSpeech ו- Speech-Modules.

לקוחות הקצה בעסקים ובארגונים בד"כ אינם רוכשים את הפתרון של זיהוי דיבור ישירות מניואנס או IBM, אלא מאחד מספקי השירות, שמרכיבים מנוע של שתי הענקיות הללו בתוך המוצר ומספקים שירות ללקוחות הקצה. למעשה, לבעל העסק בכלל לא אכפת של מי המנוע לזיהוי דיבור שיש לו במערכת. הוא מעוניין במערכת שתענה לצורך עסקי שלו. זה הקריטריון היחיד המוביל אותו ברכישת המערכת. בשוק "זיהוי הדיבור" אין את תופעת "המיתוג" הקיימת בפתרונות בתחומים אחרים בעולם ה- ICT, שבהם מותג מוביל זוכה לביקוש רק בגלל שמו והמוניטין שזכה בו. מעטים בשוק מכירים את הפתרונות של ניואנס או של IBM, משום שהם עטופים תחת השם של ספק השירות, או של המערכת שספק השירות מציג.

המוצרים והשירותים הנפוצים ביותר בישראל בשוק זיהוי הדיבור

א. מענה קולי אינטראקטיבי של Gama Operations. זו מערכת לניתוב שיחות אינטראקטיבי, מחליפה IVR, עם אפשרות ליצירת מודולים בתפירה אישית, בהתאם לצורכי הלקוח. זו מערכת יציבה הקיימת בארגונים ציבוריים ופרטיים בישראל. הפתרון כולל תוכנה ומחולל יישומים, שבעזרתו ניתן לתכנן את היישום המבוקש.

המערכת יכולה להיות מקושרת למגוון רחב של בסיסי נתונים חיצוניים ופנימיים ולהשמיע למתקשרים את המידע הרלוונטי. יישומי IVR אפשריים: מערכת הפצת הודעות, מודול שעות עבודה, מודול פתיחת שערים, השכמה, Fax On Demend ועוד. מערכות ה- IVR של חברת גאמא בנויות לעבוד עד 240 ערוצי קול ופקס (למערכת בודדת). יש תמיכה במספר שפות. המערכת תומכת כרגע ב- 6 שפות: עברית, אנגלית, רוסית, ערבית, צרפתית וגרמנית (בהתאם למחירון שפות).

המחיר: 21,000 ₪, מחיר רכישה. זה כולל אחריות וביטוח לשנה. אחרי שנה משלמים מחיר סמלי יחסית על ביטוח ואחריות לכל שנה נוספת.

ב. מערכת ניתוב שיחות של Gama Operations. זו מערכת עם יכולת זיהוי דיבור המאפשרת למתקשר להגיע לעובד אותו הוא מבקש בצורה קלה ויעילה. זאת, ע"י אמירת השם הפרטי והמשפחה/מחלקה. ניתן לשלב פתרון זה גם כספר טלפונים ארגוני, שמאפשר חיפוש חכם של אנשים באמצעות זיהוי קולי במס' מקומות כגון: בית, משרד, נייד וכדומה.

יש תמיכה נרחבת לשפה העברית (שפות נוספות בשלבי פיתוח). המוצר נתמך ע"י תוכנה היכולה לזהות גם משפטים שלמים. ניתן לרכוש כמוצר עצמאי או כמוצר משולב במערכת דואר קולי.

המערכת מבוססת על דגימות רבות במבטאים וניבים שונים ובעלת יכולת למידה. המחיר מתייחס למערכת הכוללת 2 ערוצים – ניתן להרחיב את המערכת בהתאם לדרישת הלקוח.

ניתן לרכוש כיישום בתוך מערכת Prime Voice מתוצרת גאמא או כמערכת עצמאית המסוגלת להתחבר לכל מרכזיה בעלת יכולת ניתוב. אחוזי ההצלחה של הזיהוי הקולי Voice Recognition הנם למעלה מ- 90% ומשתפרים ככל שהשימוש במערכת עולה. בנוסף, המוצר כולל יכולת ניתוב מלאה של שיחות.

המחיר: 41,000 ₪, מחיר רכישה. זה כולל אחריות וביטוח לשנה. אחרי שנה משלמים מחיר סמלי יחסית על ביטוח ואחריות לכל שנה נוספת.

 ג. מערכת VOCANOM של NSC מבית AudioCodes. זו מערכת זיהוי קולי למערכות טלפוניה ושירותים מרובי משתמשים בארגונים. מערכת VOCANOM מאפשרת ביצוע ניתוב קולי תוך אירגוני לעובדי הארגון ולמתקשרים מזדמנים המתקשרים אל הארגון. המערכת הינה מוצר מדף בעלת ממשקים סטנדרטים, שמאפשרים קיצור זמן התקנה לשעתיים בלבד.

המערכת מספקת יכולת IVR המשלבת עבודה בדיבור ו/או ב- DTMF  ומייתרת במקרים רבים צורך ב-IVR נוסף לצרכי הארגון. המוצר מיועד לארגונים בשוק ה-Enterprise וה-SMB. לקוחות ה- VOCANOM הם ממגזרי האקדמיה, ההייטק והמוסדות המוניציפליים. המערכת זכתה להצלחה רבה מאוד במגזר האקדמי, ונכון להיום הוטמעה בטכניון, האוניברסיטה העברית, מכון וייצמן, אוניברסיטת בן-גוריון בנגב ואוניברסיטת בר-אילן.

מחיר מערכת Voice Recognition, שתלוי בהיקף הפורטים וכל הציוד הנלווה מסביב הנרכש מאודיוקודס, נע בין עשרות אלפי ₪ למאה אלף ₪. הכרטיס הכי בסיסי של אודיוקודס לעסק קטן כולל שני מעבדים ותומך ב-2-8 ערוצי דיבור במקביל, ואינו מחייב רכישת חומרה או תוכנה חדשות וביצוע שדרוגים למערכות המחשוב הקיימות בארגון. כל שנדרש הוא חריץ PCI פנוי ומרכזיית טלפונים. בין השימושים האפשריים לכרטיס, שמחירו כ-1,900 דולרים, נמנים: ניהול ספרי טלפונים קוליים ארגוניים, מערכות דואר ומענה קוליים (VoiceMail), מוקדי שירות ועוד.

הערה חשובה:

לכל המוצרים הללו יש סדרה שלמה של מוצרים נלווים, שנרכשים בנפרד ובראשם מערכות הקלטה ותיעוד שיחה, תוכנות נלוות ושירותי ערך מוסף רבים, בהתאם לצרכים הייחודיים של העסק. לצורך הפעלת חלק ניכר מהתכונות האפשריות במערכות הללו, נדרשת תוספת רישיון או חומרה תוכנה בתשלום נפרד. לעיתים קרובות נדרש תשלום נוסף עבור ביצוע אינטגרציה עם מערכות CRM, Call Center, ERP, Outlook וכיו"ב, שיש כבר בעסק.

החלטה על רכישת מערכת זיהוי קולי – טיפ

למי שמהסס להיכנס לעולם זיהוי קולי בשירותי ענן, מומלץ להתחיל "בקטן". דהיינו: לבחור מרכזיה של סניף יחסית קטן ולהעביר את השירות של הזיהוי הקולי בה לענן, או לבחור יישום אחד (נניח ניתוב שיחות חכם), שיועבר לקבלת השירות עם זיהוי קולי בענן, כולל במכשירי הסלולר. בחירה בפתרון הנכון דורשת ייעוץ מהמומחים לנושא.

צריך להתחיל בקטן, להתנסות וללמוד איך זה עובד, להפיק לקחים ולהשתפר, עם מבט רחב ומפוקח על המעבר המלא לענן, לאורך ציר זמן של שנה עד שנתיים. זה הכיוון. הטיפ החשוב ביותר כאן הוא: חובה להתנסות בשירותים של ספק שירותי תקשורת מכל הסוגים ובענן, גם אם זה נעשה בקנה מידה מצומצם. ההתנסות בקנה מידה קטן בענן תוכל להוסיף מידע לתהליך קבלת ההחלטות של הארגון.

Voice Recognition – שורה תחתונה

בבחירת ספק שירות זיהוי קולי לעסק יש להשקיע מחשבה ולקבל החלטות רק לאחר הבנת הצרכים של העסק. מומלץ לבחון את החלופות השונות הקיימות כיום, שהן רבות, ולקבל החלטה המבוססת על ניתוח צרכים מול החלופות הקיימות בשוק. אנו, בכל מקרה, עומדים לרשותכם לסייע בבחינת החלופות השונות, הצגת יתרונות וחסרונות של כל חלופה, על מנת שתבחרו בחלופה האופטימלית מבחינתכם.

לקבלת הצעה למערכת זיהוי קולי Voice Recognition

Voice Recognition – תשובות לשאלות נפוצות

מערכת זיהוי קולי היא תוכנה שמסוגלת לזהות את הדובר, את המילים או את הפקודות שהוא אומר באמצעות ניתוח הקול שלו. ישנם שימושים שונים למערכות זיהוי קולי, כגון אימות ביומטרי, ניווט קולי, עוזרים חכמים וקריאת טקסט. מערכות זיהוי קולי משתמשות בטכנולוגיות כמו למידת מכונה, זיהוי תבניות וביומטריה קולית כדי להבין את הדיבור האנושי.

מערכת זיהוי קולי ביומטרית היא מערכת שמסוגלת לזהות את הזהות של אדם על ידי השוואת הקול שלו לתבנית קולית שמאוחסנת במסד נתונים. התבנית הקולית מייצגת את התכונות הייחודיות של הקול של האדם, כגון הטון, הקצב, המשך והאקצנט. מערכות זיהוי קוליות ביומטריות משתמשות בטכנולוגיות כמו למידת מכונה, זיהוי תבניות וביומטריה קולית כדי להבין ולזהות את הדיבור האנושי. מערכות זיהוי קוליות ביומטריות יכולות לשמש למטרות שונות, כגון אימות ביומטרי, ניווט קולי, עוזרים חכמים, קריאת טקסט ועוד.

ביצועי מערכת ה- ASR (Automatic Speech Recognition) נמדדים בדרך כלל באמצעות שני מדדים עיקריים: דיוק ומהירות. דיוק הוא היכולת של המערכת לזהות באופן נכון את המילים המדוברות ולתעתק אותן לטקסט בלי שגיאות. מהירות היא הזמן שלוקח למערכת להמיר את האודיו לטקסט. בדרך כלל, יש קשר הפוך בין השניים: ככל שהמערכת מהירה יותר, היא פחות מדויקת, ולהיפך. לכן, יש למצוא את האיזון הנכון בין השניים בהתאם למטרה וליישום של המערכת.

ישנם שיטות שונות למדידת דיוק ומהירות של מערכות ASR .

להלן כמה דוגמאות:

– :Word Error Rate (WER)  הוא המדד הנפוץ ביותר לדיוק של מערכות ASR . הוא מחשב את ההפרש בין התעתיק המיוצר על ידי המערכת לבין התעתיק הנכון של הדיבור. הוא משווה את מספר השגיאות (הוספות, מחיקות או החלפות) למספר המילים בתעתיק הנכון. הוא מציג את התוצאה באחוזים, כאשר ככל שה-WER נמוך יותר, הדיוק גבוה יותר.

– :Real-Time Factor (RTF)  הוא המדד הנפוץ ביותר למהירות של מערכות ASR. הוא מחשב את היחס בין הזמן שלוקח למערכת להמיר את האודיו לטקסט לבין המשך האודיו. הוא מציג את התוצאה במספר עשרוני, כאשר ככל שה-RTF קטן יותר, המהירות גבוהה יותר. אם ה-RTF קטן מ-1, זה אומר שהמערכת יכולה להמיר את האודיו בזמן אמת או מהר יותר. אם ה-RTF גדול מ-1, זה אומר שהמערכת יכולה להמיר את האודיו רק בזמן מאוחר או איטי יותר.

שימוש במערכת זיהוי קולי במרכזיות טלפון לעסקים יכול להביא ליתרונות רבים, כגון:

– חיסכון בעלויות: על ידי אוטומציה של תהליכים מסוימים, ניתן להפחית את הצורך באנשי תמיכה ומוקד, שעולים הרבה כסף לעסק. כמו כן, המערכת פועלת באופן רציף ללא צורך בהפסקות, חופשות או גמול שעות נוספות¹.

– שיפור השירות: על ידי הקשבה לקול ולצרכים של הלקוח, ניתן לנתב אותו ליעד המתאים במהירות וביעילות, בלי להטריד אותו בתפריטים מורכבים או בהמתנה ארוכה. כמו כן, המערכת יכולה להתאים את השיחה לשפה, למבטא ולהקשבה של הלקוח.

– חידוש והבלטה: על ידי הטמעת טכנולוגיה מתקדמת וחכמה, ניתן להרשים את הלקוחות ולהציג את העסק כחדשני ומוביל. כמו כן, ניתן להשתמש במערכת כדי לקדם את המותג, המוצרים או השירותים של העסק באופן יצירתי ומותאם.

לשיחה עם מהנדס טלקום אקספרט

השאירו מספר טלפון ומהנדס תקשורת יחזור אליכם, או חייגו 077-812-3111.

5/5 - (4 votes)
מעניין? שתפו ברשתות חברתיות
Facebook
Twitter
LinkedIn
אודות המחבר:

מחבר המדריך לפתרונות תקשורת ומחשוב ענן ולרכישת מרכזיות טלפון לעסקים באתרי טלקום אקספרט. לעדכונים וחדשות מעולם התקשורת והמחשוב, מוזמנים לעקוב אחריי בפייסבוק | בלינקדאין | ביוטיוב, או לכתוב לי במייל michael@teleco.co.il

השאר תגובה
פוסטים נוספים
חיוג מהירוואטסאפ