From 85c99db3a89d29bb06847c3e4077f1751b26395c Mon Sep 17 00:00:00 2001 From: Pritimay Sarkar Date: Tue, 26 Dec 2023 00:09:47 +0530 Subject: [PATCH] remove duplicates --- scripts/test_collection.py | 6 ++++-- 1 file changed, 4 insertions(+), 2 deletions(-) diff --git a/scripts/test_collection.py b/scripts/test_collection.py index b98b57b..642e391 100644 --- a/scripts/test_collection.py +++ b/scripts/test_collection.py @@ -37,6 +37,10 @@ print(df.size) #df = df[["_id", "finalResult", "classificationResult", "calculatedRatio", "deviceRatio", "kitSerial", "led1Average", "led1Buffer", "led1Sample", "led2Average", "led2Buffer", "led2Sample", "deviceId", "deviceSerialNumber", "name", "testTime"]] df = df[["_id", "classificationResult", "calculatedRatio", "deviceRatio", "kitSerial", "led1Average", "led1Buffer", "led1Sample", "led2Average", "led2Buffer", "led2Sample", "deviceId", "deviceSerialNumber", "name", "testTime"]] +print("duplicates", len(df['_id']) - len(df['_id'].drop_duplicates())) + +df = df.drop_duplicates() + # df = df.groupby(["classificationResult"]).describe() df_count = df.groupby(["classificationResult"]).describe()["calculatedRatio"]["count"] print(df.groupby(["classificationResult"]).describe()["calculatedRatio"]["count"]) @@ -53,8 +57,6 @@ print(df.groupby(["deviceSerialNumber"]).describe()["calculatedRatio"]["count"]) print(df.groupby(["kitSerial"]).describe()["calculatedRatio"]["count"]) -print("duplicates", len(df['_id']) - len(df['_id'].drop_duplicates())) - output_filename = f'tests_{datetime.today().strftime("%d_%m_%Y_%H_%M")}.xlsx' downloads_dir = os.path.join(os.path.expanduser("~"), "Downloads")