דלג לתוכן הראשי
צילום: Google
צילום: Google

דברו אליו: גוגל חשפה מודל AI חדש שהולך להבין כל מילה שלכם

דסק החדשות C14

דסק החדשות C14

לפני כשעה

ענקית הטכנולוגיה מציגה את Gemini 3.5 Transcribe, מודל תמלול חכם המסוגל להמיר דיבור לטקסט מלוטש בזמן אמת • המערכת מנקה באופן אוטומטי מילות היסוס ותיקונים עצמיים, מזהה דוברים ותומכת בעשרות שפות כולל עברית • היכולת החדשה תוטמע ישירות במקלדת Gboard, באפליקציות ובדפדפן כרום


ענקית הטכנולוגיה גוגל ממשיכה להרחיב את סדרת מודלי הבינה המלאכותית שלה והציגה אמש (רביעי) פריצת דרך משמעותית בתחום זיהוי הדיבור. החברה הכריזה על Gemini 3.5 Transcribe, מודל קולי ייעודי שתוכנן להמיר שמע לטקסט מדויק, ערוך ומפוסק בזמן אמת. בניגוד למערכות מסורתיות שמתקשות ברעשי רקע ובשגיאות דיבור, המודל החדש מבין את כוונת המשתמש ומפיק טקסט מוכן לקריאה ללא צורך בהגהה ידנית.

מחיקת גמגומים ותיקון טעויות בזמן אמת

החידוש הבולט במודל הוא היכולת לבצע "ניקוי חכם" של הדיבור האנושי. המערכת מסננת באופן עצמאי מילות מילוי והיסוסים, ויודעת להתמודד עם תיקונים עצמיים באמצע משפט, כמו "ניפגש ביום שלישי, בעצם ביום רביעי". לפי נתוני בדיקה עצמאיים, המודל מציג שיעור שגיאות מילים (WER) נמוך במיוחד של 2.6% בעיבוד קבצים ו-4% בשידור חי, ומציג מהירות תגובה גבוהה ב-70% בהשוואה לדור הקודם.

בנוסף לדיוק הגבוה, המערכת מזהה ומתמללת באופן אוטומטי יותר מ-85 שפות וניבים מקומיים, כולל תמיכה מלאה ומדויקת בשפה העברית כפי שנצפה בבדיקות המעבדה ב-Google AI Studio. המודל מסוגל לבצע הפרדה בין עד שלושה דוברים שונים בהקלטה ולהצמיד לכל משפט חותמת זמן מדויקת ברמת המילה הבודדת, מה שהופך אותו לכלי אידיאלי לסיכום ישיבות וראיונות עבודה.

תכנות בקול וזיהוי צורת דיבור

חידוש מרתק עבור קהילת הפיתוח הוא היכולת לבצע "תכנות באווירה" (Vibe Coding): בניית אפליקציות שלמות וכתיבת קוד באמצעות הנחיות קוליות בלבד ב-Google AI Studio. בנוסף, המודל משתלב בסביבת Google Antigravity ומצליב את תמליל הדיבור עם תוכן המסך והמסמכים הפתוחים כדי להבטיח דיוק מושלם. המערכת מסוגלת גם ללמוד ז'רגון מקצועי מותאם אישית, מונחים טכניים מורכבים ומספרים סידוריים, מה שהופך אותה לשימושית במיוחד במגזרי הרפואה, המשפט והפיננסים.

במכשירי אנדרואיד, המודל מניע את תכונת ה-Rambler במקלדת Gboard של גוגל, ומאפשר להפוך מחשבות מדוברות למסמך מעוצב, לתקן שגיאות ולשנות סגנון כתיבה בקול בלבד. במחשבי מק, הייחודיות של המודל מתבטאת בהבנת הקשר המסך ושליטה ישירה במיקום סמן העכבר. המערכת מסוגלת לסרוק קבצים פתוחים במחשב, לתמצת מסמכים מקומיים ואף להפיק תמונות היכן שסמן העכבר עומד – באמצעות הנחיות קוליות חופשיות המפעילות מודלים כבדים אחרים ברקע.

כך זה נראה ב-Google AI Studio | צילום מסך

בגזרת הזמינות, גוגל פותחת את המודל לשימוש מיידי עבור מפתחים ב-Google AI Studio ובסביבת Google Antigravity, וכן ללקוחות עסקיים בפלטפורמת Gemini Enterprise דרך ממשקי API לשידור חי ולעיבוד קבצים. עבור המשתמשים הפרטיים, הפיצ'ר זמין כבר כעת באפליקציית המק באנגלית ובמקלדת Gboard באנדרואיד במדינות נבחרות, וצפוי להתרחב בקרוב לדפדפן כרום כדי לאפשר הכתבה קולית בכל שדה טקסט ברשת.