Overview
Gemini 3 Pro एक स्पीच-टू-टेक्स्ट मॉडल है जो घंटों की बोली गई ऑडियो को लिखित पाठ में परिवर्तित करता है, Picasso IA पर सीधे उपलब्ध है बिना किसी सॉफ्टवेयर डाउनलोड या तकनीकी सेटअप के। यह स्वाभाविक रूप से पत्रकारों के काम में फिट बैठता है जो लंबे साक्षात्कारों को ट्रांसक्राइब कर रहे हैं, पॉडकास्ट निर्माता एपिसोड को लिखित स्क्रिप्ट में परिवर्तित कर रहे हैं, या टीमें जिन्हें रिकॉर्ड की गई मीटिंग को खोजने योग्य दस्तावेज़ों में बदलने की आवश्यकता है। आप चाहने वाले प्रारूप का वर्णन करने वाला एक छोटा प्रॉम्प्ट लिखते हैं, अपनी फाइल अपलोड करते हैं, और मॉडल उपयोग के लिए तैयार साफ पाठ आउटपुट देता है। 8.4 घंटे तक की फाइलें एक ही सत्र में समर्थित हैं, जिसका मतलब है कि अधिकांश वास्तविक-दुनिया रिकॉर्डिंग को शुरू करने से पहले विभाजित करने की आवश्यकता नहीं है।
How It Works
- आप जो वापस चाहते हैं उसका वर्णन करने वाला एक छोटा प्रॉम्प्ट लिखें, उदाहरण के लिए एक शब्द-दर-शब्द ट्रांसक्रिप्ट, एक विषय-आधारित सारांश, या अनुभाग शीर्षकों के साथ एक रूपरेखा
- अपनी ऑडियो फाइल अपलोड करें (8.4 घंटे तक), या एक वीडियो फाइल जोड़ें यदि बोली गई सामग्री वीडियो प्रारूप में रिकॉर्ड की गई है
- एक थिंकिंग लेवल चुनें: कम सीधी भाषण पर तेज़ परिणाम देता है, उच्च घने या तकनीकी रूप से जटिल ऑडियो पर गहरी प्रोसेसिंग लागू करता है
- अधिकतम आउटपुट टोकन सेट करें ताकि प्रतिक्रिया को एक संक्षिप्त सारांश तक सीमित किया जा सके या पूर्ण शब्दशः ट्रांसक्रिप्ट के लिए इसे उच्च रखें
- अनुरोध सबमिट करें और पाठ आउटपुट को सीधे अपने डॉक्यूमेंट एडिटर, नोट-लेने वाले टूल, CMS, या कैप्शनिंग सॉफ्टवेयर में पेस्ट करें
Frequently Asked Questions
क्या मुझे इसका उपयोग करने के लिए प्रोग्रामिंग कौशल या तकनीकी ज्ञान की आवश्यकता है?
नहीं, बस Gemini 3 Pro को Picasso IA पर खोलें, अपनी चाहने वाली सेटिंग को समायोजित करें, और जेनरेट करें।
क्या इसे आजमाना मुफ्त है?
हां, आप एक सशुल्क योजना के बिना Gemini 3 Pro का उपयोग शुरू कर सकते हैं। मॉडल पृष्ठ खोलें, एक छोटा क्लिप अपलोड करें, और अपना पहला ट्रांसक्रिप्ट जेनरेट करें ताकि आप लंबी फाइलों के लिए प्रतिबद्ध होने से पहले यह देख सकें कि यह कैसे प्रदर्शन करता है।
परिणाम प्राप्त करने में कितना समय लगता है?
छोटी क्लिप अक्सर एक मिनट से कम में परिणाम देती हैं। लंबी फाइलें या उच्च थिंकिंग लेवल के साथ सत्र दो से तीन मिनट ले सकते हैं। आपको पूरे समय पृष्ठ पर रहने की आवश्यकता नहीं है।
यह किस प्रकार की फाइलें स्वीकार करता है?
मॉडल मानक ऑडियो फाइल प्रारूपों के साथ काम करता है और वीडियो फाइलों को सीधे प्रोसेस कर सकता है, बिना एक अलग निष्कर्षण चरण के वीडियो से बोली गई सामग्री को खींचता है।
क्या मैं ट्रांसक्रिप्ट के प्रारूप को नियंत्रित कर सकता हूं?
हां। आपका पाठ प्रॉम्प्ट वह जगह है जहां आप प्रारूप सेट करते हैं। एक स्पीकर-लेबल किए गए ट्रांसक्रिप्ट, बुलेट-पॉइंट सारांश, टाइमस्टैम्प किए गए सेगमेंट, या प्रवाहित गद्य मांगें, और मॉडल उस संरचना का पालन करेगा।
यदि परिणाम पर्याप्त सटीक नहीं है तो क्या?
अपने प्रॉम्प्ट को अधिक विशिष्ट करने के लिए फिर से तैयार करें, थिंकिंग लेवल बढ़ाएं, या अधिक शाब्दिक आउटपुट के लिए तापमान सेटिंग को कम करें। अधिकांश समस्याएं एक या दो समायोजन के बाद सुधार होती हैं।
मैं पाठ आउटपुट का उपयोग कहां कर सकता हूं?
आउटपुट कोई वॉटरमार्क के साथ साफ पाठ है। इसे किसी भी शब्द प्रोसेसर, प्रकाशन प्लेटफॉर्म, कैप्शनिंग टूल, या डेटाबेस में पेस्ट करें। इस बात पर कोई प्रतिबंध नहीं है कि आप जेनरेट की गई सामग्री का उपयोग कैसे करते हैं।