From 6609faaec8ceced93008b9cb40386e46e7429852 Mon Sep 17 00:00:00 2001 From: Pritimay Sarkar Date: Fri, 6 Oct 2023 00:17:24 +0530 Subject: [PATCH] remove duplicates --- scripts/combine15.py | 8 ++++---- 1 file changed, 4 insertions(+), 4 deletions(-) diff --git a/scripts/combine15.py b/scripts/combine15.py index 89e5f73..409a788 100644 --- a/scripts/combine15.py +++ b/scripts/combine15.py @@ -17,10 +17,10 @@ print(df.columns) df['Age'] = 2023 - df['birthYear'] -df = df[["_id", "name", "abhaId", "aadharId", "Age", "gender", "category", "maritalStatus", "house", "district", "state", "pinCode", "phoneNumber", "classificationResult", "bloodGroup", "createdAt", "caste"]] +df = df[["_id", "name", "abhaId", "aadharId", "Age", "gender", "category", "maritalStatus", "house", "district", "state", "pinCode", "phoneNumber", "classificationResult", "bloodGroup", "testTime", "caste"]] print(df) -df.rename(columns={'_id': "Sample ID", "name": "Name", "abhaId": "ABHA ID", "aadharId": "Aadhaar ID", "gender": "Gender", "category": "Category", "maritalStatus": "Marital Status", "house": "Address", "district": "District", "state": "State", "pinCode": "Pincode", "phoneNumber": "Mobile Number", "createdAt": "Date", "classificationResult": "Test Result", "bloodGroup": "Blood Group", "Age": "Age", "caste": "Caste"}, inplace = True) +df.rename(columns={'_id': "Sample ID", "name": "Name", "abhaId": "ABHA ID", "aadharId": "Aadhaar ID", "gender": "Gender", "category": "Category", "maritalStatus": "Marital Status", "house": "Address", "district": "District", "state": "State", "pinCode": "Pincode", "phoneNumber": "Mobile Number", "testTime": "Date", "classificationResult": "Test Result", "bloodGroup": "Blood Group", "Age": "Age", "caste": "Caste"}, inplace = True) df = df.reindex(["Sample ID", "Name", "ABHA ID", "Aadhaar ID", "Age", "Gender", "Caste", "Category", "Marital Status", "Address", "District", "State", "Pincode", "Mobile Number", "Date", "Test Result", "Blood Group"], axis=1) # df['Date'] = pd.to_datetime(df["Date"].dt.strftime('%d-%m-%Y')) @@ -29,7 +29,7 @@ df = df.reindex(["Sample ID", "Name", "ABHA ID", "Aadhaar ID", "Age", "Gender", df["Test Result"].fillna("Retest", inplace = True) df = df[df["Test Result"] != "Retest"] -df_final = df +df_final = df.sort_values('Date').drop_duplicates('Sample ID', keep='last') df_final.loc[df_final['Test Result'] == 'Normal', 'Test Result'] = 'Normal (HbA)' df_final.loc[df_final['Test Result'] == 'Sickle Cell Trait', 'Test Result'] = 'Sickle Cell Trait (HbAS)' @@ -44,7 +44,7 @@ print(df_final.groupby(["Test Result"]).describe()) df_count = df.groupby(["Test Result"]).describe()["ABHA ID"]["count"] print(df.groupby(["Test Result"]).describe()["ABHA ID"]["count"]) -writer = pd.ExcelWriter(curdir + path_delim + "data/Oct5.xlsx", engine = 'openpyxl') +writer = pd.ExcelWriter(curdir + path_delim + "data/Oct5c.xlsx", engine = 'openpyxl') df_final.to_excel(writer, sheet_name = 'op', index=False) df_count.to_excel(writer, sheet_name = "count") writer.close()