ROUTINE COLLECTIONDATA SCIENCE FOUNDATIONS데이터 사이언스 기본편

하나의 데이터셋으로 끝까지 실행하는 루틴입니다.

지금 열 수 있는 루틴 4개 · 가장 짧은 루틴 7일 · 무브 20

데이터를 구하거나 전처리할 일이 없습니다. 첫날 연 파일을 마지막 날까지 그대로 사용하며, 각 MOVE에서 가설을 검정하거나 모형을 추정합니다. 마치면 루틴 목표와 완료 평가로 내가 무엇을 할 수 있게 되었는지 직접 확인합니다.

딸기 데이터로 푸는 표본의 비밀

2가지 가설
7 days · 3 Moves
루틴 목표
표본이 모집단을 얼마나 대표하는지 판단할 수 있다
완료 평가
모수와 표본통계량의 차이를 검정으로 확인할 수 있다
M0 DATASET
딸기 숙성 전후 당도 및 품질 평가200행 8변수 · 설계 4 / 결과 3 · 결측 0.0%
MOVES & 가설
  • M1
    모평균과 모분산을 아는 경우표준정규분포 · z평균가설 1딸기 표본평균은 모집단의 모평균과 같은가
    SIMULATION
    • 표본평균 분포준비 중
  • M2
    모분산을 모르는 경우t분포 · df = n−1평균가설 1모분산을 표본에서 추정해도 같은 결론인가
    SIMULATION
    • 표준화된 표본평균 분포준비 중
  • M3
    모분산을 아는 경우카이제곱분포 · χ²분산가설 2딸기 표본분산은 모집단의 모분산과 같은가
    SIMULATION
    • 표준화된 표본분산 분포준비 중

수학적 창의성 데이터로 푸는 가설검정의 비밀

7가지 가설
21 days · 7 Moves
루틴 목표
자료 구조에 맞는 검정을 골라 적용할 수 있다
완료 평가
일곱 가설을 각각의 검정통계량으로 판정할 수 있다
M0 DATASET
보드게임 전후 수학적 창의성 점수사전 · 사후 · 세 집단(교사 개입 / 미개입 / 독서)
MOVES & 가설
  • M1
    대응표본 t검정차이평균평균가설 1-1보드게임 집단은 사전보다 사후 점수가 향상되었는가
    SIMULATION
    • 사전-사후 점수 산점도준비 중
  • M2
    독립표본 t검정평균차이평균가설 2-1보드게임집단은 독서집단보다 향상점수가 큰가
    SIMULATION
    • 보드게임집단과 독서집단의 사전-사후 향상점수 분포 비교준비 중
    • 보드게임집단과 독서집단의 사전-사후 분포 비교 1준비 중
    • 보드게임집단과 독서집단의 사전-사후 분포 비교 2준비 중
  • M3
    일원분산분석 F검정집단간 / 집단내 분산비평균가설 2-2교사개입 보드게임집단, 교사 미개입 보드게임집단, 독서집단의 향상점수는 서로 다른가
    SIMULATION
    • 더미 회귀준비 중
  • M4
    상관분석 t검정상관계수관계가설 3-1보드게임 전 창의력 점수와 보드게임 후 창의성 점수는 서로 상관이 있는가
    SIMULATION
    • 보드게임집단 vs. 독서집단: 사전-사후 상관준비 중
  • M5
    단순선형회귀분석 F검정회귀 / 잔차 분산비관계가설 3-2보드게임 전 창의성 점수는 보드게임 후 창의성 점수를 설명하는가
    SIMULATION
    • 보드게임집단 vs. 독서집단: 사전-사후 회귀직선 비교준비 중
  • M6
    단순선형회귀분석 t검정기울기와 절편관계가설 3-3보드게임 전 창의성 점수의 회귀계수는 유의한가
    SIMULATION
    • 보드게임집단 vs. 독서집단: 사전-사후 회귀직선 비교 — 평균점 이동 및 회귀선 신뢰밴드 포함준비 중
  • M7
    일원공분산분석 F검정공변량 보정 후 분산비통제가설 2-3사전점수를 통제해도 보드게임 처치 효과가 있는가
    SIMULATION
    • 중심화 후 회귀분석준비 중

한우 데이터로 푸는 선형모형의 비밀

4가지 선형모형
14 days · 4 Moves
루틴 목표
고정효과와 임의효과를 구분해 모형을 세울 수 있다
완료 평가
BLUE와 BLUP의 차이를 같은 데이터에서 설명할 수 있다
M0 DATASET
한우 근내지방도 · 단일 SNP1000행 11변수 · 설계 5 / 결과 5 · 결측 1.06%
MOVES & 모형 판정

수소엔진 데이터로 푸는 머신러닝의 비밀

6가지 머신러닝 모델
21 days · 6 Moves
루틴 목표
모델 복잡도와 예측 성능의 교환을 판단할 수 있다
완료 평가
여섯 모델의 파라미터 수와 성능을 한 표로 비교할 수 있다
M0 DATASET
수소엔진 운전 데이터입력 10변수 · 출력 4(효율, NOx, 조기점화, 노킹)
MOVES & 모형 추정

어떤 루틴부터 시작할까요

다루고 싶은 데이터를 고르면 됩니다. 루틴 하나에 데이터셋 하나라, 고민할 것이 그것뿐입니다.

ROUTINEDATASET루틴 목표완료 평가권장 반복 횟수기간
표본의 비밀R1-1딸기 숙성 전후 당도표본이 모집단을 얼마나 대표하는지 판단할 수 있다모수와 표본통계량의 차이를 검정으로 확인할 수 있다기간 내 3회 이상7 days
가설검정의 비밀R2-1보드게임 전후 창의성 점수자료 구조에 맞는 검정을 골라 적용할 수 있다일곱 가설을 각각의 검정통계량으로 판정할 수 있다기간 내 3회 이상21 days
선형모형의 비밀R3-1한우 근내지방도 · 단일 SNP고정효과와 임의효과를 구분해 모형을 세울 수 있다BLUE와 BLUP의 차이를 같은 데이터에서 설명할 수 있다기간 내 3회 이상14 days
머신러닝의 비밀R4-1수소엔진 운전 데이터모델 복잡도와 예측 성능의 교환을 판단할 수 있다여섯 모델의 파라미터 수와 성능을 한 표로 비교할 수 있다기간 내 3회 이상21 days

ROUTINE의 결과는 내가 만드는 ARTICLE입니다.

정해진 기간 내 하나의 데이터셋으로 Routine을 3회 이상 반복하며 가설 검정·모형 판정·모형 추정의 전 과정을 익힙니다. 그다음 자신의 가설을 검정하거나 모형을 완성하는 데 필요한 데이터를 직접 수집하거나 생성합니다. 이렇게 내가 만드는 데이터가 나의 DATASET이고, 그 DATASET이 무엇을 의미하는지 해석·설명하는 것이 ARTICLE입니다.

ROUTINE

제공된 데이터로 가설 검정·모형 판정·모형 추정의 전 과정을 정해진 기간 내 3회 이상 반복합니다.

DATASET

자신의 가설을 검정하거나 모형을 완성하는 데 필요한 데이터를 직접 수집하거나 생성합니다.

ARTICLE

그 DATASET이 무엇을 의미하는지 해석하고 설명합니다.

저자 강의 클래스에서는 학습자가 만든 ARTICLE을 완료 평가합니다. 완성된 ARTICLE 가운데 투고 후보 한 편을 선정하고, 이를 Data Article 원고로 발전시켜 투고합니다.