टेक्स्ट और डेटा टूल

CSV डुप्लिकेट हटाएँ

पूरी पंक्ति या चुने फ़ील्ड से डुप्लिकेट पहचानें, पहला रिकॉर्ड रखें और CSV निर्यात करें।

CSV सामग्री

डुप्लिकेट रहित CSV

तालिका पूर्वावलोकन

पूरी पंक्ति या चुने कॉलम से CSV डुप्लिकेट हटाएँ। पहला रिकॉर्ड, कॉलम क्रम और सही CSV एस्केप सुरक्षित रहते हैं।

CSV फ़ाइलें केवल आपके ब्राउज़र में संसाधित होती हैं; सर्वर पर अपलोड नहीं होतीं।

यह टूल क्या करता है

टूल पहले CSV को पार्स करके फ़ील्ड ऐरे की तुलना करता है। पूरी पंक्ति या एक से अधिक कॉलम इंडेक्स की संयुक्त कुंजी से डुप्लिकेट खोज सकते हैं। पहला रिकॉर्ड रखा जाता है; शीर्षक डेटा की डुप्लिकेट तुलना में शामिल नहीं होता।

इस्तेमाल कैसे करें

  1. CSV पेस्ट करें या UTF-8 फ़ाइल चुनें; विभाजक और शीर्षक सेटिंग जाँचें।
  2. पार्स करने के बाद पूरी पंक्ति चुनें या क्रमांक वाले एक या अधिक कॉलम चुनें।
  3. डुप्लिकेट रिकॉर्ड हटाएँ दबाकर मूल, बचे और हटाए रिकॉर्ड की संख्या देखें।
  4. सीमित तालिका पूर्वावलोकन जाँचें और सही एस्केप वाला CSV कॉपी या डाउनलोड करें।

उदाहरण

  • a,b / 1,2 / 1,2 / 2,3 में पूरी पंक्ति के आधार पर दो डेटा रिकॉर्ड बचते हैं।
  • id,name / 1,Tom / 1,Jack / 2,Amy में id चुनने पर 1,Tom और 2,Amy बचते हैं।
  • name (कॉलम 1) और name (कॉलम 2) को अलग चुन सकते हैं; समान शीर्षक भ्रम पैदा नहीं करते।

नियम और सीमाएँ

पहली पंक्ति डिफ़ॉल्ट रूप से शीर्षक है। हर डुप्लिकेट समूह का पहला रिकॉर्ड और मूल क्रम सुरक्षित रहते हैं। तुलना कुंजी फ़ील्ड ऐरे के अस्पष्टता रहित सीरियलाइज़ेशन से बनती है, साधारण विभाजक जोड़कर नहीं। मूल फ़ील्ड की सटीक तुलना होती है; स्पेस या संख्याएँ अपने आप नहीं बदलतीं। CSV आउटपुट उसी Papa Parse कोर से बनता है, जो विभाजक, उद्धरण और नई पंक्ति वाले फ़ील्ड सही उद्धृत करता है। इनपुट सीमा 2 MiB, 100,000 रिकॉर्ड, 500 कॉलम और 500,000 खाने है; पूर्वावलोकन सीमा 500 पंक्तियाँ, 100 कॉलम और 10,000 खाने है।

आम उपयोग

  • दोहराए गए निर्यात रिकॉर्ड हटाएँ।
  • ID, ईमेल या संयुक्त फ़ील्ड के आधार पर पहला रिकॉर्ड रखें।
  • समान शीर्षक वाले कॉलम बचाते हुए CSV व्यवस्थित करें।

गोपनीयता

टेक्स्ट, फ़ाइल पढ़ना, रूपांतरण और पूर्वावलोकन सभी इसी ब्राउज़र में स्थानीय रूप से होते हैं। इनपुट अपलोड नहीं होता; बैकएंड, डेटाबेस, ऑनलाइन API या तीसरे पक्ष का CDN इस्तेमाल नहीं होता और सामग्री अपने आप सहेजी नहीं जाती। कॉपी और डाउनलोड भी ब्राउज़र में स्थानीय रूप से होते हैं।

FAQ

पूरी पंक्ति के आधार पर हटाने का क्या अर्थ है?

सभी फ़ील्ड की सामग्री और स्थिति समान होने पर ही रिकॉर्ड डुप्लिकेट हैं। चुने कॉलम वाले मोड में केवल चुने फ़ील्ड की तुलना होती है।

कौन-सा डुप्लिकेट रिकॉर्ड रहता है?

पहला पूरा रिकॉर्ड रखा जाता है। बाकी फ़ील्ड भी उसी रिकॉर्ड से आते हैं और आउटपुट का क्रम स्थिर रहता है।

क्या समान शीर्षक से डेटा मिटेगा?

नहीं। अंदर कॉलम इंडेक्स इस्तेमाल होता है और इंटरफ़ेस क्रमांक दिखाता है। नाम को अकेली कुंजी नहीं माना जाता।

आउटपुट में उद्धरण कैसे संभलते हैं?

विभाजक, उद्धरण या नई पंक्ति वाले फ़ील्ड CSV नियमों से उद्धृत होते हैं। फ़ील्ड का अंदरूनी दोहरा उद्धरण दो बार लिखा जाता है।

क्या फ़ॉर्मूले या स्पेस अपने आप बदलेंगे?

नहीं। मूल फ़ील्ड बिना अपने आप ट्रिम या बदलाव के रहते हैं। स्प्रेडशीट में आयात करते समय डेटा के अनुसार टेक्स्ट या दूसरा कॉलम प्रकार चुनें।

डेवलपर टूल की सूची पर लौटें