전체 글 (46) 썸네일형 리스트형 [머신러닝] 2025년 주요 머신러닝 트렌드와 발전방향 [2025년 머신러닝 주요 트렌드]1. 초거대 모델의 실용화 • 대규모 모델이 연구 단계를 넘어 실제 서비스에 본격 적용 • 성능보다 비용 대비 효율과 안정성이 중요해짐 • 기업 내부 업무 자동화에 적극 활용2. 멀티모달 머신러닝 확산 • 텍스트·이미지·음성·영상 데이터를 동시에 학습 • 인간의 인지 방식에 가까운 이해 능력 강화 • 챗봇, 검색, 의료 진단 분야에서 빠르게 확산3. AutoML과 MLOps의 대중화 • 모델 설계·학습·배포 전 과정 자동화 • 비전문가도 머신러닝을 활용할 수 있는 환경 조성 • 운영 안정성과 재현성이 핵심 이슈로 부상4. 엣지 AI 및 온디바이스 학습 • 클라우드 의존을 줄이고 기기 자체에서 추론 수행 • 실시간 처리, 개인정보 보호 강화 • 자율주행, IoT, 스마트 .. [머신러닝] 산업별 머신러닝 적용사례 1. 금융(Finance)① 신용평가 / 대출 심사 • 목적: 대출 상환 가능성 예측 • 기술: 분류 모델 (Logistic Regression, XGBoost, Random Forest) • 사례 • 고객의 소득, 소비 패턴, 연체 이력 기반 신용 점수 산정 • 비금융 데이터(모바일 사용 패턴 등) 활용한 중금리 대출 심사② 이상 거래 탐지 (Fraud Detection) • 목적: 금융 사기 탐지 • 기술: 이상치 탐지, 비지도학습, Autoencoder • 사례 • 카드 결제 패턴과 다른 거래 발생 시 실시간 차단 • 보이스피싱 의심 계좌 탐지③ 주가·자산 예측 • 목적: 투자 의사결정 지원 • 기술: 시계열 모델(LSTM, ARIMA) • 사례 • 과거 주가 + 뉴스 감성 분석 기반 예측2. 의료.. [머신러닝] 머신러닝 프로젝트 흐름 총정리 1. 문제 정의 및 목표 설정 (Problem Definition & Goal Setting)비즈니스 문제 이해: 어떤 문제를 해결하려고 하는지, 머신러닝이 이 문제를 해결하는 데 적합한 도구인지 명확히 정의합니다.목표 설정: 달성하고자 하는 구체적인 목표와 성공 지표(예: 정확도 95% 달성, 비용 10% 절감 등)를 정의합니다.요구사항 분석: 필요한 데이터 유형, 예상되는 결과물의 형태 등을 파악합니다. 2. 데이터 수집 (Data Collection)데이터 확보: 정의된 문제 해결에 필요한 데이터를 수집합니다. 내부 데이터베이스, 외부 공개 데이터셋, 또는 웹 크롤링 등 다양한 방법을 활용할 수 있습니다.데이터 레이블링: 지도 학습 모델의 경우, 데이터에 정답(레이블)을 지정하는 과정이 포함될 수 .. [AI] 비정형 데이터 처리 개요 정리 📌 비정형 데이터 처리 개요 정리 1️⃣ 이미지·텍스트·오디오 데이터의 특징🖼️ 이미지(Image)고차원 데이터(픽셀 수가 많음)공간적 구조(픽셀 간 위치 관계) 존재조명·각도 등 환경 영향 큼파일 용량 큼📝 텍스트(Text)문장 구조 일정하지 않음단어 순서·문맥 정보 중요언어적 의미·감정 포함오타·중복·이모지 등 노이즈 많음숫자화(임베딩)가 필수🎧 오디오(Audio)시간 흐름이 중요한 시계열 데이터주파수 정보 포함소음, 녹음 환경 영향 큼길이가 제각각 → 패딩 필요스펙트럼 변환 등 추가 처리 자주 필요 2️⃣ 전처리 방식 차이🖼️ 이미지 전처리정규화(픽셀 0~1 스케일링)리사이즈로 입력 크기 통일데이터 증강(회전·자르기·밝기 변경 등)색상 변환(RGB → grayscale 등)📝 텍스트 전.. [머신러닝] 고차원 데이터 처리 시 주의 점 고차원 데이터의 문제점을 정리해보자.1. 비효율성분석대상 공간의 데이터의 밀도가 낮아지면 빈 공간이 많아지게 되는데 이는 데이터 분석에 과도한 부담을 주어 성능을 느리게 하거나 분석을 어렵게 만든다. 특히, 공간 데이터의 경우 데이터 간의 거리를 기반으로 분석하는 경우가 많다. 2. 과적합 차원이 커지면 생길 수 있는 또 다른 문제는 과적합이다. 많은 변수를 넣어 모델의 복잡도가 높아지면 모델의 정교함은 커지지만 약간의 입력 오차에도 오차는 커지게 된다. 3. 설명력우리는 3차원만 넘어가도 자료의 구조가 어떻게 생겼는지 쉽게 설명하거나 머리로 떠올리기가 힘들다. 차원이 높아질수록 데이터의 특성이나 분석모델을 설명하는 것은 더 힘들어진다. 한가지 예로, 10개 과목 성적 모두를 분석하지 않고 국.영.수 3.. [머신러닝] 특징 선택 VS 특징 추출 특징의 정의 및 중요성 - 머신러닝이나 데이터 분석에 사용되는 개별 독립변수를 의미한다.- 데이터는 머신러닝의 핵심이다.- 데이터 속에서 특징을 정제하고 선택하는 과정은 필수이다.Feature Engineering데이터속에서 유의미한 특징을 정제하고 선택하는 과정으로, 데이터 품질을 높이고 모델의 성능을 향상시키기 위한 필수적인 단계이다. [효과]- 모델 성능 향상- 차원 축소- 계산 효율성 향상[대표적인 종류]- Feature Extraction / Feature SelectionFeature Extraction원본 데이터의 중요한 특성을 최대한 유지하면서,분석에 필요하지 않은 특성을 제거하여더 효율적이고 의미있는 데이터로 만드는 과정을 의미한다.PCA- 특징 추출의 대표 기법 중 하나이다. - 데이터.. [머신러닝] PCA(주성분 분석) 이란? PCA(주성분 분석)이란?PCA는 대표적인 차원축소에 쓰이는 기법으로 머신러닝, 데이터 마이닝, 통계분석 ,노이즈 제거 등 다양한 분야에서 널리 쓰인다.쉽게 말해 PCA를 이용하면 고차원의 데이터를 낮은 차원의 데이터로 바꿔 줄 수 있다는 것인데,중요한것은 “어떻게 차원을 잘 낮추느냐”이다.아무리 잘 바꾼다고 해도 2차원의 데이터의 특징을 모두 살리면서 1차원의 데이터로 바꿔 줄 수는 없을 것이다.그렇다면 모든 특징을 살릴 수는 없을지라도 최대한 특징을 살리며 차원을 낮춰주는 방법을 고안했고 그 중 하나가 PCA이다. [머신러닝] 차원 축소의 필요성 차원이란 ? 데이터 분석에 사용되는 변수의 개수차원을 줄인다 ? 사용되는 변수의 개수를 줄인다.차원축소의 개념은 결국 변수의 숫자를 줄이는 것이다. 하지만 변수의 개수를 줄인다면 데이터 정보의 손실을 감수해야하는 부분이다. 차원의 축소이유 3가지1. 차원의 저주 (비용, 시간, 자원, 용량 문제)차원의 저주(Curse of Dimension)는 차원이 커짐에 따라서 공간의 범위가 기하급수적으로 증가해서 많은 Sample이 필요해지는 현상을 말한다. 차원이 커지면서 두 데이터간의 거리가 멀어지고 밀도가 급격히 줄어들게 된다.컴퓨터 차원에서 이러한 빈 공간들을 0으로 저장하게 된다.즉, Sparse가 커지게 되는것이다.이처럼 데이터를 저장해야하는 부피, 밀도 등이 증가해서 고차원에서 데이터 분석은 많은 변수.. 이전 1 2 3 4 ··· 6 다음