माइक्रोसॉफ्ट के शोधकर्ताओं ने एक नया बड़ा भाषा मॉडल (LLM) विकसित किया है जो एक तृतीयक (-1, 0, 1) वज़न प्रणाली का उपयोग करता है, जिससे मेमोरी का उपयोग और कम्प्यूटेशनल ज़रूरतें काफी कम हो जाती हैं। यह "1.58-बिट" मॉडल, जिसे 4 ट्रिलियन टोकन्स के साथ मूल रूप से बड़े पैमाने पर प्रशिक्षित किया गया है, पूर्ण-परिशुद्धता मॉडल के बराबर प्रदर्शन प्राप्त करता है, जो डेस्कटॉप CPU पर कुशलतापूर्वक चलता है। पिछली क्वांटाइजेशन विधियों के विपरीत, यह ओपन-सोर्स मॉडल महत्वपूर्ण प्रदर्शन में गिरावट से बचता है, जो कुशल LLM डिज़ाइन में एक महत्वपूर्ण प्रगति को दर्शाता है।
Prepared by Jonathan Pierce and reviewed by editorial team.
Comments