remove duplicates

This commit is contained in:
Pritimay Sarkar
2023-12-26 00:09:47 +05:30
parent 4bf9ffd5f6
commit 85c99db3a8

View File

@@ -37,6 +37,10 @@ print(df.size)
#df = df[["_id", "finalResult", "classificationResult", "calculatedRatio", "deviceRatio", "kitSerial", "led1Average", "led1Buffer", "led1Sample", "led2Average", "led2Buffer", "led2Sample", "deviceId", "deviceSerialNumber", "name", "testTime"]]
df = df[["_id", "classificationResult", "calculatedRatio", "deviceRatio", "kitSerial", "led1Average", "led1Buffer", "led1Sample", "led2Average", "led2Buffer", "led2Sample", "deviceId", "deviceSerialNumber", "name", "testTime"]]
print("duplicates", len(df['_id']) - len(df['_id'].drop_duplicates()))
df = df.drop_duplicates()
# df = df.groupby(["classificationResult"]).describe()
df_count = df.groupby(["classificationResult"]).describe()["calculatedRatio"]["count"]
print(df.groupby(["classificationResult"]).describe()["calculatedRatio"]["count"])
@@ -53,8 +57,6 @@ print(df.groupby(["deviceSerialNumber"]).describe()["calculatedRatio"]["count"])
print(df.groupby(["kitSerial"]).describe()["calculatedRatio"]["count"])
print("duplicates", len(df['_id']) - len(df['_id'].drop_duplicates()))
output_filename = f'tests_{datetime.today().strftime("%d_%m_%Y_%H_%M")}.xlsx'
downloads_dir = os.path.join(os.path.expanduser("~"), "Downloads")