În acest articol, vom explora procesul de adăugare a unei noi coloane la un Pandas DataFrame, o bibliotecă populară în Python pentru manipularea și analiza datelor. Vom discuta soluția acestei probleme, vom parcurge o explicație pas cu pas a codului și vom acoperi câteva subiecte și funcții conexe din biblioteca Pandas. Pandas este o bibliotecă utilizată pe scară largă, cu structuri și instrumente de date de nivel înalt, perfecte pentru analiza eficientă a datelor și sarcini de manipulare.
Pentru început, să presupunem că avem un set de date sub forma unui Pandas DataFrame și dorim să îi adăugăm o nouă coloană. Aceasta este o cerință comună în etapa de pregătire a datelor, adesea necesară pentru ingineria caracteristicilor sau pentru a genera informații suplimentare pe baza coloanelor existente. Să vedem cum se poate realiza acest lucru.
Adăugarea unei noi coloane la un Pandas DataFrame
Vom începe prin a importa biblioteca necesară și a crea un exemplu de DataFrame.
import pandas as pd
data = {'Name': ['Alex', 'Tom', 'Nick', 'Sam'],
'Age': [25, 28, 23, 22],
'City': ['NY', 'LA', 'SF', 'Chicago']}
df = pd.DataFrame(data)
Acum, să adăugăm o nouă coloană „Țară” la DataFrame-ul nostru cu o valoare implicită, să spunem „SUA”.
df['Country'] = 'USA'
Această linie simplă de cod va adăuga o nouă coloană numită „Țară” la DataFrame-ul nostru existent „df” cu valoarea „USA” în toate rândurile sale. DataFrame-ul nostru actualizat ar arăta astfel:
Name Age City Country 0 Alex 25 NY USA 1 Tom 28 LA USA 2 Nick 23 SF USA 3 Sam 22 Chicago USA
Explicația codului pas cu pas
Să defalcăm codul și să-l înțelegem pas cu pas.
1. Mai întâi, importăm biblioteca Pandas folosind aliasul standard „pd”. Acest lucru ne permite să accesăm funcțiile și clasele Pandas folosind prefixul „pd”.
import pandas as pd
2. În continuare, creăm un dicționar „date” care conține câteva date eșantion. Fiecare cheie din dicționar reprezintă un nume de coloană, iar valoarea ei corespunzătoare este o listă de valori pentru acea coloană.
data = {'Name': ['Alex', 'Tom', 'Nick', 'Sam'],
'Age': [25, 28, 23, 22],
'City': ['NY', 'LA', 'SF', 'Chicago']}
3. Apoi convertim acest dictionar intr-un obiect Pandas DataFrame folosind functia `pd.DataFrame()`.
df = pd.DataFrame(data)
4. În cele din urmă, pentru a adăuga o nouă coloană, pur și simplu folosim operatorul de atribuire „=" cu DataFrame, furnizând noul nume de coloană între paranteze pătrate și specificând valoarea implicită. În cazul nostru, am adăugat coloana „Țară” cu valoarea implicită „SUA”.
df['Country'] = 'USA'
Biblioteca Pandas și funcții conexe
Pandas este o bibliotecă Python puternică, potrivită în special pentru sarcini de procesare, curățare și analiză a datelor. Aceasta oferă două structuri de date principale: DataFrame și Series . Un DataFrame este o structură de date tabelară bidimensională cu axe etichetate (rânduri și coloane). O Series, pe de altă parte, este o matrice etichetată unidimensională capabilă să conțină date de orice tip.
Unele funcții comune Pandas legate de adăugarea, modificarea și ștergerea coloanelor dintr-un DataFrame sunt următoarele:
- introduce(): Pentru a insera o coloană într-o poziție specificată.
- cădere brusca(): Pentru a elimina o coloană din DataFrame.
- redenumește(): Pentru a redenumi o coloană a unui DataFrame.
- atribui(): Pentru a crea o nouă coloană bazată pe rezultatul unei expresii.
Deci, adăugarea unei noi coloane la un Pandas DataFrame este simplă și eficientă. În acest articol, am acoperit metoda de bază de a adăuga o nouă coloană cu o valoare implicită și am oferit explicații detaliate pentru pașii implicați. De asemenea, am introdus Pandas ca o bibliotecă puternică de manipulare a datelor și am discutat despre câteva funcții conexe pentru gestionarea coloanelor DataFrame. Stăpânind aceste tehnici, veți fi bine echipat pentru a gestiona o gamă largă de sarcini de procesare a datelor în Python.