गूगल जेमिनी और ओपनएआई ने पेश किया नया ‘रियल-टाइम वॉइस एंड विजन एआई’: डॉक्टरों और इंजीनियरों को मिलेगी सेकंडों में मदद
✍️ सौरभ श्रीवास्तव
📅 प्रकाशित: 1/9/2026
एआई तकनीक में इंसानी बातचीत जैसा सहज अनुभव। प्राकृतिक हाव-भाव, रुकावटों को समझना और 100 भाषाओं में एक साथ धाराप्रवाह अनुवाद।
वैश्विक आर्टिफिशियल इंटेलिजेंस रिसर्च लैब्स ने अपने अगली पीढ़ी के 'रियल-टाइम ओमनी-मल्टीमॉडल एआई' (Omni Multimodal AI) प्लेटफॉर्म को वैश्विक स्तर पर रोलआउट करना शुरू कर दिया है। यह प्रणाली बिना किसी टेक्स्ट टाइपिंग के सीधे कैमरे के विजुअल फीड और इंसानी आवाज को शून्य लेटेंसी (150 मिलीसेकंड) के साथ समझकर उत्तर देती है।
**एक्स-रे और मेडिकल रिपोर्ट्स का तुरंत प्राथमिक विश्लेषण:**
डॉक्टर यदि अपने फोन कैमरे से मरीज की ईसीजी या एमआरआई रिपोर्ट दिखाते हैं, तो यह एआई मॉडल मेडिकल लिटरेचर के संदर्भ के साथ असामान्यताओं को तुरंत हाईलाइट कर देता है। हालांकि विशेषज्ञों ने इसे केवल डॉक्टर की सहायता के रूप में उपयोग करने की सलाह दी है।
**छात्रों के लिए व्यक्तिगत एआई शिक्षक:**
गणित या भौतिकी के कठिन समीकरणों की तस्वीर खींचते ही एआई आवाज के माध्यम से स्टेप-बाय-स्टेप गाइड करता है और छात्र के किसी भी प्रश्न का उसी क्षण लाइव उत्तर देता है।