<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>ideas30180 님의 블로그</title>
    <link>https://ideas30180.tistory.com/</link>
    <description>ideas30180 님의 블로그 입니다.</description>
    <language>ko</language>
    <pubDate>Tue, 28 Jul 2026 02:10:50 +0900</pubDate>
    <generator>TISTORY</generator>
    <ttl>100</ttl>
    <managingEditor>ideas30180</managingEditor>
    <item>
      <title>QAQC본캠프 36일차</title>
      <link>https://ideas30180.tistory.com/50</link>
      <description>&lt;p data-end=&quot;258&quot; data-start=&quot;189&quot; data-ke-size=&quot;size16&quot;&gt;오늘은 기존의 &lt;b&gt;단순선형회귀&lt;/b&gt;에서 한 단계 확장해, 실제 데이터에 더 잘 대응하기 위한 회귀 모델 확장 방법을 학습했다.&lt;/p&gt;
&lt;p data-end=&quot;291&quot; data-start=&quot;260&quot; data-ke-size=&quot;size16&quot;&gt;단순선형회귀는 하나의 X 변수로 Y를 예측하는 방식이다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;ini&quot;&gt;&lt;code&gt;y = b0 + b1x&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;417&quot; data-start=&quot;319&quot; data-ke-size=&quot;size16&quot;&gt;하지만 실제 데이터는 단순한 직선 관계로 설명되지 않는 경우가 많다.&lt;br /&gt;그래서 입력 변수를 추가하거나, 기존 변수를 변형해서 모델이 더 복잡한 패턴을 학습할 수 있게 만든다.&lt;/p&gt;
&lt;hr data-end=&quot;422&quot; data-start=&quot;419&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;445&quot; data-start=&quot;424&quot; data-section-id=&quot;60ynf1&quot; data-ke-size=&quot;size26&quot;&gt;2. 단순선형회귀와 다항회귀 차이&lt;/h2&gt;
&lt;p data-end=&quot;478&quot; data-start=&quot;447&quot; data-ke-size=&quot;size16&quot;&gt;단순선형회귀는 데이터의 흐름을 &lt;b&gt;직선&lt;/b&gt;으로 설명한다.&lt;/p&gt;
&lt;p data-end=&quot;533&quot; data-start=&quot;480&quot; data-ke-size=&quot;size16&quot;&gt;반면, 다항회귀는 x&amp;sup2; 같은 항을 추가해서 데이터의 흐름을 &lt;b&gt;곡선&lt;/b&gt;으로 설명할 수 있다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;makefile&quot;&gt;&lt;code&gt;단순선형회귀:
y = b0 + b1x

다항회귀:
y = b0 + b1x + b2x&amp;sup2;&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;653&quot; data-start=&quot;596&quot; data-ke-size=&quot;size16&quot;&gt;즉, 데이터가 직선 형태가 아니라 휘어진 형태를 보이면 단순선형회귀보다 다항회귀가 더 적합할 수 있다.&lt;/p&gt;
&lt;hr data-end=&quot;658&quot; data-start=&quot;655&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;682&quot; data-start=&quot;660&quot; data-section-id=&quot;ey6i34&quot; data-ke-size=&quot;size26&quot;&gt;3. 수치형 데이터와 범주형 데이터&lt;/h2&gt;
&lt;p data-end=&quot;726&quot; data-start=&quot;684&quot; data-ke-size=&quot;size16&quot;&gt;데이터는 크게 &lt;b&gt;수치형 데이터&lt;/b&gt;와 &lt;b&gt;범주형 데이터&lt;/b&gt;로 나눌 수 있다.&lt;/p&gt;
&lt;h3 data-end=&quot;739&quot; data-start=&quot;728&quot; data-section-id=&quot;13v0n&quot; data-ke-size=&quot;size23&quot;&gt;수치형 데이터&lt;/h3&gt;
&lt;p data-end=&quot;764&quot; data-start=&quot;741&quot; data-ke-size=&quot;size16&quot;&gt;수치형 데이터는 숫자로 표현되는 데이터다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;구분설명예시
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;879&quot; data-start=&quot;766&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody data-end=&quot;879&quot; data-start=&quot;797&quot;&gt;
&lt;tr data-end=&quot;838&quot; data-start=&quot;797&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;807&quot; data-start=&quot;797&quot;&gt;연속형 데이터&lt;/td&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;828&quot; data-start=&quot;807&quot;&gt;값 사이가 무한히 나눠질 수 있음&lt;/td&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;838&quot; data-start=&quot;828&quot;&gt;키, 몸무게&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;879&quot; data-start=&quot;839&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;849&quot; data-start=&quot;839&quot;&gt;이산형 데이터&lt;/td&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;866&quot; data-start=&quot;849&quot;&gt;값 사이가 유한하게 나눠짐&lt;/td&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;879&quot; data-start=&quot;866&quot;&gt;주사위 눈, 나이&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;h3 data-end=&quot;892&quot; data-start=&quot;881&quot; data-section-id=&quot;m17qb3&quot; data-ke-size=&quot;size23&quot;&gt;범주형 데이터&lt;/h3&gt;
&lt;p data-end=&quot;925&quot; data-start=&quot;894&quot; data-ke-size=&quot;size16&quot;&gt;범주형 데이터는 특정 그룹이나 종류를 나타내는 데이터다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;구분설명예시
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1022&quot; data-start=&quot;927&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody data-end=&quot;1022&quot; data-start=&quot;958&quot;&gt;
&lt;tr data-end=&quot;989&quot; data-start=&quot;958&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;967&quot; data-start=&quot;958&quot;&gt;순서형 자료&lt;/td&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;979&quot; data-start=&quot;967&quot;&gt;순서 의미가 있음&lt;/td&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;989&quot; data-start=&quot;979&quot;&gt;학점, 등급&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1022&quot; data-start=&quot;990&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;999&quot; data-start=&quot;990&quot;&gt;명목형 자료&lt;/td&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1011&quot; data-start=&quot;999&quot;&gt;순서 의미가 없음&lt;/td&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1022&quot; data-start=&quot;1011&quot;&gt;혈액형, 성별&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;hr data-end=&quot;1027&quot; data-start=&quot;1024&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;1046&quot; data-start=&quot;1029&quot; data-section-id=&quot;z4kg5v&quot; data-ke-size=&quot;size26&quot;&gt;4. 범주형 데이터 인코딩&lt;/h2&gt;
&lt;p data-end=&quot;1128&quot; data-start=&quot;1048&quot; data-ke-size=&quot;size16&quot;&gt;머신러닝 모델은 기본적으로 숫자를 기반으로 학습한다.&lt;br /&gt;따라서 성별, 혈액형, 날짜처럼 문자나 범주로 표현된 데이터는 그대로 사용할 수 없다.&lt;/p&gt;
&lt;p data-end=&quot;1175&quot; data-start=&quot;1130&quot; data-ke-size=&quot;size16&quot;&gt;이런 데이터를 숫자로 바꾸는 과정을 &lt;b&gt;인코딩(Encoding)&lt;/b&gt; 이라고 한다.&lt;/p&gt;
&lt;p data-end=&quot;1208&quot; data-start=&quot;1177&quot; data-ke-size=&quot;size16&quot;&gt;예를 들어 성별 데이터가 있다면 다음처럼 바꿀 수 있다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;angelscript&quot;&gt;&lt;code&gt;남성 &amp;rarr; 0
여성 &amp;rarr; 1&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;1327&quot; data-start=&quot;1237&quot; data-ke-size=&quot;size16&quot;&gt;하지만 명목형 데이터는 순서 의미가 없기 때문에 단순히 숫자를 부여할 때 주의해야 한다.&lt;br /&gt;모델이 1이 0보다 크다는 식으로 잘못 해석할 수 있기 때문이다.&lt;/p&gt;
&lt;hr data-end=&quot;1332&quot; data-start=&quot;1329&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;1349&quot; data-start=&quot;1334&quot; data-section-id=&quot;xwex1b&quot; data-ke-size=&quot;size26&quot;&gt;5. 오늘의 실습 흐름&lt;/h2&gt;
&lt;p data-end=&quot;1369&quot; data-start=&quot;1351&quot; data-ke-size=&quot;size16&quot;&gt;오늘 실습의 흐름은 다음과 같다.&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-end=&quot;1437&quot; data-start=&quot;1371&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li data-end=&quot;1384&quot; data-start=&quot;1371&quot; data-section-id=&quot;1ltzyv2&quot;&gt;범주형 데이터 확인&lt;/li&gt;
&lt;li data-end=&quot;1404&quot; data-start=&quot;1385&quot; data-section-id=&quot;42k2ku&quot;&gt;범주형 데이터를 숫자로 인코딩&lt;/li&gt;
&lt;li data-end=&quot;1416&quot; data-start=&quot;1405&quot; data-section-id=&quot;4kgbo&quot;&gt;회귀 모델 훈련&lt;/li&gt;
&lt;li data-end=&quot;1425&quot; data-start=&quot;1417&quot; data-section-id=&quot;kqujgj&quot;&gt;모델 학습&lt;/li&gt;
&lt;li data-end=&quot;1437&quot; data-start=&quot;1426&quot; data-section-id=&quot;fgmb9u&quot;&gt;예측 결과 평가&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-end=&quot;1552&quot; data-start=&quot;1439&quot; data-ke-size=&quot;size16&quot;&gt;핵심은 &lt;b&gt;모델에 넣기 전 데이터 형태를 맞춰야 한다는 것&lt;/b&gt;이다.&lt;br /&gt;좋은 모델을 쓰는 것도 중요하지만, 그 전에 데이터를 모델이 이해할 수 있는 형태로 바꾸는 전처리가 중요하다는 점을 다시 확인했다.&lt;/p&gt;
&lt;hr data-end=&quot;1557&quot; data-start=&quot;1554&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;1576&quot; data-start=&quot;1559&quot; data-section-id=&quot;15r2vp4&quot; data-ke-size=&quot;size26&quot;&gt;6. 오늘의 핵심 인사이트&lt;/h2&gt;
&lt;p data-end=&quot;1606&quot; data-start=&quot;1578&quot; data-ke-size=&quot;size16&quot;&gt;오늘 학습하면서 가장 중요하게 느낀 점은 다음이다.&lt;/p&gt;
&lt;blockquote data-end=&quot;1676&quot; data-start=&quot;1608&quot; data-ke-style=&quot;style1&quot;&gt;
&lt;p data-end=&quot;1676&quot; data-start=&quot;1610&quot; data-ke-size=&quot;size16&quot;&gt;회귀 모델의 성능은 단순히 모델 자체보다도&lt;br /&gt;어떤 변수를 넣고, 데이터를 어떻게 변환하느냐에 크게 영향을 받는다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-end=&quot;1772&quot; data-start=&quot;1678&quot; data-ke-size=&quot;size16&quot;&gt;단순선형회귀로 설명이 부족한 데이터는 변수 추가나 다항식 변환을 통해 더 잘 설명할 수 있다.&lt;br /&gt;또한 범주형 데이터는 인코딩을 거쳐야 머신러닝 모델에 사용할 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;1859&quot; data-start=&quot;1774&quot; data-ke-size=&quot;size16&quot;&gt;즉, 머신러닝에서 중요한 것은 단순히 알고리즘을 실행하는 것이 아니라,&lt;br /&gt;&lt;b&gt;데이터의 특성을 이해하고 모델이 학습 가능한 형태로 설계하는 과정&lt;/b&gt;이다.&lt;/p&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/50</guid>
      <comments>https://ideas30180.tistory.com/50#entry50comment</comments>
      <pubDate>Thu, 2 Jul 2026 20:53:16 +0900</pubDate>
    </item>
    <item>
      <title>QAQC본캠프 35일차</title>
      <link>https://ideas30180.tistory.com/49</link>
      <description>&lt;p data-end=&quot;279&quot; data-start=&quot;43&quot; data-ke-size=&quot;size16&quot;&gt;오늘은 tips 데이터를 활용해서 &lt;b&gt;선형회귀 모델&lt;/b&gt;을 적용하는 실습을 했다.&lt;br /&gt;이번 실습의 핵심은 total_bill을 독립변수 X로 두고, tip을 종속변수 Y로 설정하여 &lt;b&gt;전체 지불금액이 팁 금액에 어떤 영향을 주는지&lt;/b&gt; 확인하는 것이었다. 자료에서도 total_bill은 전체 지불금액, tip은 팁 금액으로 설명되어 있다.&lt;/p&gt;
&lt;hr data-end=&quot;284&quot; data-start=&quot;281&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;294&quot; data-start=&quot;286&quot; data-section-id=&quot;o4acz4&quot; data-ke-size=&quot;size26&quot;&gt;핵심 개념&lt;/h2&gt;
&lt;p data-end=&quot;334&quot; data-start=&quot;296&quot; data-ke-size=&quot;size16&quot;&gt;선형회귀는 독립변수와 종속변수 사이의 선형 관계를 학습하는 모델이다.&lt;/p&gt;
&lt;p data-end=&quot;365&quot; data-start=&quot;336&quot; data-ke-size=&quot;size16&quot;&gt;이번 실습에서는 다음과 같은 구조로 분석을 진행했다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;ini&quot;&gt;&lt;code&gt;X = tips_df[['total_bill']]
y = tips_df['tip']&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;431&quot; data-start=&quot;429&quot; data-ke-size=&quot;size16&quot;&gt;즉,&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;&quot;&gt;&lt;code&gt;전체 지불금액 total_bill &amp;rarr; 팁 금액 tip 예측&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;500&quot; data-start=&quot;479&quot; data-ke-size=&quot;size16&quot;&gt;이라는 관계를 모델로 학습하는 것이다.&lt;/p&gt;
&lt;hr data-end=&quot;505&quot; data-start=&quot;502&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;515&quot; data-start=&quot;507&quot; data-section-id=&quot;qdlaio&quot; data-ke-size=&quot;size26&quot;&gt;실습 흐름&lt;/h2&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;stylus&quot;&gt;&lt;code&gt;from sklearn.linear_model import LinearRegression

X = tips_df[['total_bill']]
y = tips_df['tip']

model = LinearRegression()
model.fit(X, y)

print(model.coef_)
print(model.intercept_)
print(model.score(X, y))&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;898&quot; data-start=&quot;743&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;778&quot; data-start=&quot;743&quot; data-section-id=&quot;10nzs5g&quot;&gt;LinearRegression() : 선형회귀 모델 생성&lt;/li&gt;
&lt;li data-end=&quot;801&quot; data-start=&quot;779&quot; data-section-id=&quot;lh57rx&quot;&gt;fit(X, y) : 데이터 학습&lt;/li&gt;
&lt;li data-end=&quot;818&quot; data-start=&quot;802&quot; data-section-id=&quot;1gd8esy&quot;&gt;coef_ : 회귀계수&lt;/li&gt;
&lt;li data-end=&quot;838&quot; data-start=&quot;819&quot; data-section-id=&quot;1016lln&quot;&gt;intercept_ : 절편&lt;/li&gt;
&lt;li data-end=&quot;867&quot; data-start=&quot;839&quot; data-section-id=&quot;mcmjpe&quot;&gt;score(X, y) : 결정계수 R&amp;sup2; 확인&lt;/li&gt;
&lt;li data-end=&quot;898&quot; data-start=&quot;868&quot; data-section-id=&quot;47ewpr&quot;&gt;predict() : 새로운 데이터에 대한 예측&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-end=&quot;903&quot; data-start=&quot;900&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;913&quot; data-start=&quot;905&quot; data-section-id=&quot;19jgco9&quot; data-ke-size=&quot;size26&quot;&gt;이해한 점&lt;/h2&gt;
&lt;p data-end=&quot;1027&quot; data-start=&quot;915&quot; data-ke-size=&quot;size16&quot;&gt;total_bill과 tip은 모두 연속형 변수이기 때문에 선형회귀 분석에 사용할 수 있다.&lt;br /&gt;회귀계수가 양수라면 전체 지불금액이 증가할수록 팁 금액도 증가하는 경향이 있다고 해석할 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;1213&quot; data-start=&quot;1029&quot; data-ke-size=&quot;size16&quot;&gt;또한 결정계수 R&amp;sup2;를 통해 total_bill이 tip을 얼마나 잘 설명하는지도 확인할 수 있다.&lt;br /&gt;R&amp;sup2; 값이 높을수록 모델이 데이터를 잘 설명한다고 볼 수 있지만, 팁 금액은 지불금액 외에도 성별, 흡연 여부, 요일, 식사 시간, 식사 인원 등의 영향을 받을 수 있기 때문에 단일 변수만으로 완벽하게 예측하기는 어렵다.&lt;/p&gt;
&lt;hr data-end=&quot;1218&quot; data-start=&quot;1215&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;1229&quot; data-start=&quot;1220&quot; data-section-id=&quot;2h7vai&quot; data-ke-size=&quot;size26&quot;&gt;헷갈렸던 점&lt;/h2&gt;
&lt;p data-end=&quot;1267&quot; data-start=&quot;1231&quot; data-ke-size=&quot;size16&quot;&gt;처음에는 coef_와 intercept_가 조금 헷갈렸다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1344&quot; data-start=&quot;1269&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1309&quot; data-start=&quot;1269&quot; data-section-id=&quot;84y407&quot;&gt;coef_는 X가 1 증가할 때 Y가 얼마나 변하는지를 의미한다.&lt;/li&gt;
&lt;li data-end=&quot;1344&quot; data-start=&quot;1310&quot; data-section-id=&quot;hya3go&quot;&gt;intercept_는 X가 0일 때의 기본 예측값이다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-end=&quot;1471&quot; data-start=&quot;1346&quot; data-ke-size=&quot;size16&quot;&gt;또한 X를 만들 때는 tips_df['total_bill']처럼 Series로 넣는 것이 아니라, tips_df[['total_bill']]처럼 &lt;b&gt;2차원 DataFrame 형태&lt;/b&gt;로 넣어야 한다는 점이 중요했다.&lt;/p&gt;
&lt;hr data-end=&quot;1476&quot; data-start=&quot;1473&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;1485&quot; data-start=&quot;1478&quot; data-section-id=&quot;1g57rnp&quot; data-ke-size=&quot;size26&quot;&gt;느낀 점&lt;/h2&gt;
&lt;p data-end=&quot;1617&quot; data-start=&quot;1487&quot; data-ke-size=&quot;size16&quot;&gt;선형회귀는 단순히 예측만 하는 모델이 아니라, 변수 간 관계를 식으로 해석할 수 있다는 점이 좋았다.&lt;br /&gt;특히 total_bill과 tip처럼 현실적으로도 관계가 예상되는 데이터를 사용하니 회귀분석의 의미가 더 잘 이해되었다.&lt;/p&gt;
&lt;p data-is-only-node=&quot;&quot; data-is-last-node=&quot;&quot; data-end=&quot;1718&quot; data-start=&quot;1619&quot; data-ke-size=&quot;size16&quot;&gt;다음에는 total_bill 하나만 사용하는 단순 선형회귀뿐 아니라, size, day, time 같은 다른 변수도 함께 사용해서 다중 선형회귀로 확장해보고 싶다.&lt;/p&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/49</guid>
      <comments>https://ideas30180.tistory.com/49#entry49comment</comments>
      <pubDate>Wed, 1 Jul 2026 20:16:28 +0900</pubDate>
    </item>
    <item>
      <title>QAQC본캠프 34일차</title>
      <link>https://ideas30180.tistory.com/48</link>
      <description>&lt;p data-end=&quot;212&quot; data-start=&quot;47&quot; data-ke-size=&quot;size16&quot;&gt;오늘은 scikit-learn을 활용해서 &lt;b&gt;선형회귀 모델을 생성하고, 학습하고, 평가하는 기본 흐름&lt;/b&gt;을 학습했다.&lt;br /&gt;특히 LinearRegression() 모델을 만들고, fit()으로 학습한 뒤, coef_, intercept_를 통해 회귀식을 해석하는 방법을 익혔다.&lt;/p&gt;
&lt;p data-end=&quot;457&quot; data-start=&quot;214&quot; data-ke-size=&quot;size16&quot;&gt;또한 회귀 모델의 성능을 평가할 때 사용하는 &lt;b&gt;MSE, RMSE, MAE, R&amp;sup2;&lt;/b&gt; 개념도 함께 정리했다. 학습 자료에서는 MSE를 실제값과 예측값의 차이를 제곱한 뒤 평균낸 지표로 설명하고, RMSE는 MSE에 루트를 씌워 단위를 맞춘 지표, MAE는 절댓값 기반 오차 지표로 설명한다. R&amp;sup2;는 회귀선이 전체 데이터를 얼마나 설명할 수 있는지를 나타내는 지표이다.&lt;/p&gt;
&lt;hr data-end=&quot;462&quot; data-start=&quot;459&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;493&quot; data-start=&quot;464&quot; data-section-id=&quot;14dwh5h&quot; data-ke-size=&quot;size26&quot;&gt;1. LinearRegression import&lt;/h2&gt;
&lt;p data-end=&quot;521&quot; data-start=&quot;495&quot; data-ke-size=&quot;size16&quot;&gt;처음에는 아래처럼 잘못 import하려고 했다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;elm&quot;&gt;&lt;code&gt;import scikit-learn as sklearn&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;630&quot; data-start=&quot;569&quot; data-ke-size=&quot;size16&quot;&gt;하지만 파이썬에서 사용할 때는 패키지명을 그대로 쓰는 것이 아니라 sklearn으로 import해야 한다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;angelscript&quot;&gt;&lt;code&gt;from sklearn.linear_model import LinearRegression

model_lr = LinearRegression()&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;796&quot; data-start=&quot;728&quot; data-ke-size=&quot;size16&quot;&gt;scikit-learn은 설치 이름이고, 코드에서 불러올 때는 sklearn을 사용한다는 점을 확실히 알게 되었다.&lt;/p&gt;
&lt;hr data-end=&quot;801&quot; data-start=&quot;798&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;817&quot; data-start=&quot;803&quot; data-section-id=&quot;8e7nxt&quot; data-ke-size=&quot;size26&quot;&gt;2. 모델 학습 흐름&lt;/h2&gt;
&lt;p data-end=&quot;842&quot; data-start=&quot;819&quot; data-ke-size=&quot;size16&quot;&gt;선형회귀 모델의 기본 흐름은 다음과 같다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;makefile&quot;&gt;&lt;code&gt;from sklearn.linear_model import LinearRegression

model_lr = LinearRegression()

X = tips_df[[&quot;total_bill&quot;]]
y = tips_df[&quot;tip&quot;]

model_lr.fit(X, y)&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;1049&quot; data-start=&quot;1008&quot; data-ke-size=&quot;size16&quot;&gt;여기서 중요한 점은 X는 &lt;b&gt;2차원 데이터&lt;/b&gt;로 넣어야 한다는 것이다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;lua&quot;&gt;&lt;code&gt;X = tips_df[[&quot;total_bill&quot;]]&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;1151&quot; data-start=&quot;1094&quot; data-ke-size=&quot;size16&quot;&gt;반면 아래처럼 쓰면 1차원 Series가 되기 때문에 머신러닝 모델 입력값으로 적절하지 않을 수 있다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;ini&quot;&gt;&lt;code&gt;X = tips_df[&quot;total_bill&quot;]&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;hr data-end=&quot;1197&quot; data-start=&quot;1194&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;1216&quot; data-start=&quot;1199&quot; data-section-id=&quot;1att5jp&quot; data-ke-size=&quot;size26&quot;&gt;3. 회귀계수와 절편 확인&lt;/h2&gt;
&lt;p data-end=&quot;1268&quot; data-start=&quot;1218&quot; data-ke-size=&quot;size16&quot;&gt;학습된 모델에서는 coef_와 intercept_를 통해 회귀식을 확인할 수 있다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;stylus&quot;&gt;&lt;code&gt;w1 = model_lr.coef_[0]
w0 = model_lr.intercept_

print(f&quot;y = {w1:.2f}x + {w0:.2f}&quot;)&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;1380&quot; data-start=&quot;1369&quot; data-ke-size=&quot;size16&quot;&gt;의미는 다음과 같다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;코드의미
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1495&quot; data-start=&quot;1382&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody data-end=&quot;1495&quot; data-start=&quot;1404&quot;&gt;
&lt;tr data-end=&quot;1436&quot; data-start=&quot;1404&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1423&quot; data-start=&quot;1404&quot;&gt;model_lr.coef_&lt;/td&gt;
&lt;td data-end=&quot;1436&quot; data-start=&quot;1423&quot; data-col-size=&quot;sm&quot;&gt;기울기, 회귀계수&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1467&quot; data-start=&quot;1437&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1461&quot; data-start=&quot;1437&quot;&gt;model_lr.intercept_&lt;/td&gt;
&lt;td data-end=&quot;1467&quot; data-start=&quot;1461&quot; data-col-size=&quot;sm&quot;&gt;절편&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1495&quot; data-start=&quot;1468&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1486&quot; data-start=&quot;1468&quot;&gt;y = w1*x + w0&lt;/td&gt;
&lt;td data-end=&quot;1495&quot; data-start=&quot;1486&quot; data-col-size=&quot;sm&quot;&gt;선형회귀식&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;1599&quot; data-start=&quot;1497&quot; data-ke-size=&quot;size16&quot;&gt;coef_가 array 형태로 나오는 이유는 입력 변수가 여러 개일 수도 있기 때문이다.&lt;br /&gt;입력 변수가 1개라면 model_lr.coef_[0]으로 숫자만 꺼낼 수 있다.&lt;/p&gt;
&lt;hr data-end=&quot;1604&quot; data-start=&quot;1601&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;1620&quot; data-start=&quot;1606&quot; data-section-id=&quot;d16cx2&quot; data-ke-size=&quot;size26&quot;&gt;4. 회귀 평가 지표&lt;/h2&gt;
&lt;p data-end=&quot;1653&quot; data-start=&quot;1622&quot; data-ke-size=&quot;size16&quot;&gt;회귀 모델은 예측값과 실제값의 차이를 기준으로 평가한다.&lt;/p&gt;
&lt;h3 data-end=&quot;1662&quot; data-start=&quot;1655&quot; data-section-id=&quot;1xxfh31&quot; data-ke-size=&quot;size23&quot;&gt;MSE&lt;/h3&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;reasonml&quot;&gt;&lt;code&gt;from sklearn.metrics import mean_squared_error

mse = mean_squared_error(y_true, y_pred)&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;1795&quot; data-start=&quot;1768&quot; data-ke-size=&quot;size16&quot;&gt;MSE는 &lt;b&gt;오차를 제곱한 뒤 평균낸 값&lt;/b&gt;이다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;erlang&quot;&gt;&lt;code&gt;MSE가 작을수록 예측값이 실제값에 가깝다.&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;1865&quot; data-start=&quot;1835&quot; data-ke-size=&quot;size16&quot;&gt;오늘 실습 중에는 함수명을 잘못 입력해서 에러가 났다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;reasonml&quot;&gt;&lt;code&gt;mean_spuared_error(y_true, y_pred2)&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;1934&quot; data-start=&quot;1918&quot; data-ke-size=&quot;size16&quot;&gt;올바른 함수명은 다음과 같다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;reasonml&quot;&gt;&lt;code&gt;mean_squared_error(y_true, y_pred2)&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;2017&quot; data-start=&quot;1987&quot; data-ke-size=&quot;size16&quot;&gt;즉, spuared가 아니라 squared이다.&lt;/p&gt;
&lt;hr data-end=&quot;2022&quot; data-start=&quot;2019&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h3 data-end=&quot;2032&quot; data-start=&quot;2024&quot; data-section-id=&quot;ynoqnj&quot; data-ke-size=&quot;size23&quot;&gt;RMSE&lt;/h3&gt;
&lt;p data-end=&quot;2056&quot; data-start=&quot;2034&quot; data-ke-size=&quot;size16&quot;&gt;RMSE는 MSE에 루트를 씌운 값이다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;ini&quot;&gt;&lt;code&gt;RMSE = &amp;radic;MSE&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;2151&quot; data-start=&quot;2083&quot; data-ke-size=&quot;size16&quot;&gt;MSE는 오차를 제곱하기 때문에 단위가 달라질 수 있는데, RMSE는 루트를 씌워 원래 단위에 더 가깝게 해석할 수 있다.&lt;/p&gt;
&lt;hr data-end=&quot;2156&quot; data-start=&quot;2153&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h3 data-end=&quot;2165&quot; data-start=&quot;2158&quot; data-section-id=&quot;1xxfgtr&quot; data-ke-size=&quot;size23&quot;&gt;MAE&lt;/h3&gt;
&lt;p data-end=&quot;2189&quot; data-start=&quot;2167&quot; data-ke-size=&quot;size16&quot;&gt;MAE는 오차의 절댓값을 평균낸 값이다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;gherkin&quot;&gt;&lt;code&gt;MAE = |실제값 - 예측값|의 평균&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;2261&quot; data-start=&quot;2226&quot; data-ke-size=&quot;size16&quot;&gt;제곱을 하지 않기 때문에 MSE보다 이상치의 영향을 덜 받는다.&lt;/p&gt;
&lt;hr data-end=&quot;2266&quot; data-start=&quot;2263&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h3 data-end=&quot;2274&quot; data-start=&quot;2268&quot; data-section-id=&quot;1hs05ie&quot; data-ke-size=&quot;size23&quot;&gt;R&amp;sup2;&lt;/h3&gt;
&lt;p data-end=&quot;2313&quot; data-start=&quot;2276&quot; data-ke-size=&quot;size16&quot;&gt;R&amp;sup2;는 회귀선이 데이터를 얼마나 잘 설명하는지를 나타내는 지표이다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;angelscript&quot;&gt;&lt;code&gt;R&amp;sup2;가 1에 가까울수록 설명력이 높다.
R&amp;sup2;가 0에 가까울수록 평균값으로 예측하는 것과 큰 차이가 없다.&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;2456&quot; data-start=&quot;2387&quot; data-ke-size=&quot;size16&quot;&gt;즉, 선형회귀에서는 단순히 오차만 보는 것이 아니라, 모델이 전체 데이터의 변동성을 얼마나 설명하는지도 함께 확인해야 한다.&lt;/p&gt;
&lt;hr data-end=&quot;2461&quot; data-start=&quot;2458&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;2486&quot; data-start=&quot;2463&quot; data-section-id=&quot;p3jop&quot; data-ke-size=&quot;size26&quot;&gt;5. Seaborn 시각화 에러 해결&lt;/h2&gt;
&lt;p data-end=&quot;2514&quot; data-start=&quot;2488&quot; data-ke-size=&quot;size16&quot;&gt;산점도를 그리다가 아래와 같은 에러가 발생했다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;routeros&quot;&gt;&lt;code&gt;sns.scatterplot(data=tips_df, X=&quot;total_bill&quot;, y=&quot;tip&quot;)&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;2645&quot; data-start=&quot;2586&quot; data-ke-size=&quot;size16&quot;&gt;에러 원인은 X를 대문자로 쓴 것이었다.&lt;br /&gt;Seaborn에서는 x, y를 소문자로 써야 한다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;routeros&quot;&gt;&lt;code&gt;sns.scatterplot(data=tips_df, x=&quot;total_bill&quot;, y=&quot;tip&quot;)&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;2755&quot; data-start=&quot;2717&quot; data-ke-size=&quot;size16&quot;&gt;회귀선까지 함께 보고 싶다면 regplot()을 사용할 수 있다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;routeros&quot;&gt;&lt;code&gt;sns.regplot(data=tips_df, x=&quot;total_bill&quot;, y=&quot;tip&quot;)&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;hr data-end=&quot;2826&quot; data-start=&quot;2823&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;2843&quot; data-start=&quot;2828&quot; data-section-id=&quot;64i6jl&quot; data-ke-size=&quot;size26&quot;&gt;오늘 발생한 에러 정리&lt;/h2&gt;
&lt;div&gt;
&lt;div&gt;에러원인해결
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;3207&quot; data-start=&quot;2845&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody data-end=&quot;3207&quot; data-start=&quot;2876&quot;&gt;
&lt;tr data-end=&quot;2956&quot; data-start=&quot;2876&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2915&quot; data-start=&quot;2876&quot;&gt;NameError: name 'x' is not defined&lt;/td&gt;
&lt;td data-end=&quot;2932&quot; data-start=&quot;2915&quot; data-col-size=&quot;sm&quot;&gt;x 변수를 만들지 않음&lt;/td&gt;
&lt;td data-end=&quot;2956&quot; data-start=&quot;2932&quot; data-col-size=&quot;sm&quot;&gt;X = df[[&quot;컬럼명&quot;]] 생성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;3056&quot; data-start=&quot;2957&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2987&quot; data-start=&quot;2957&quot;&gt;UnicodeDecodeError: cp949&lt;/td&gt;
&lt;td data-end=&quot;3024&quot; data-start=&quot;2987&quot; data-col-size=&quot;sm&quot;&gt;주피터가 sklearn 객체를 HTML로 표시하다 인코딩 충돌&lt;/td&gt;
&lt;td data-end=&quot;3056&quot; data-start=&quot;3024&quot; data-col-size=&quot;sm&quot;&gt;set_config(display=&quot;text&quot;)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;3124&quot; data-start=&quot;3057&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;3091&quot; data-start=&quot;3057&quot;&gt;NameError: mean_spuared_error&lt;/td&gt;
&lt;td data-end=&quot;3100&quot; data-start=&quot;3091&quot; data-col-size=&quot;sm&quot;&gt;함수명 오타&lt;/td&gt;
&lt;td data-end=&quot;3124&quot; data-start=&quot;3100&quot; data-col-size=&quot;sm&quot;&gt;mean_squared_error&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;3207&quot; data-start=&quot;3125&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;3161&quot; data-start=&quot;3125&quot;&gt;unexpected keyword argument 'X'&lt;/td&gt;
&lt;td data-end=&quot;3192&quot; data-start=&quot;3161&quot; data-col-size=&quot;sm&quot;&gt;scatterplot()에서 X 대문자 사용&lt;/td&gt;
&lt;td data-end=&quot;3207&quot; data-start=&quot;3192&quot; data-col-size=&quot;sm&quot;&gt;x 소문자로 수정&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;hr data-end=&quot;3212&quot; data-start=&quot;3209&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;3225&quot; data-start=&quot;3214&quot; data-section-id=&quot;11huhn1&quot; data-ke-size=&quot;size26&quot;&gt;최종 정리 코드&lt;/h2&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;routeros&quot;&gt;&lt;code&gt;from sklearn import set_config
from sklearn.linear_model import LinearRegression
from sklearn.metrics import mean_squared_error
import seaborn as sns
import matplotlib.pyplot as plt

set_config(display=&quot;text&quot;)

X = tips_df[[&quot;total_bill&quot;]]
y = tips_df[&quot;tip&quot;]

model_lr = LinearRegression()
model_lr.fit(X, y)

y_pred = model_lr.predict(X)

w1 = model_lr.coef_[0]
w0 = model_lr.intercept_

print(f&quot;회귀식: y = {w1:.2f}x + {w0:.2f}&quot;)

mse = mean_squared_error(y, y_pred)
print(&quot;MSE:&quot;, mse)

sns.regplot(data=tips_df, x=&quot;total_bill&quot;, y=&quot;tip&quot;)
plt.show()&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;hr data-end=&quot;3792&quot; data-start=&quot;3789&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;3803&quot; data-start=&quot;3794&quot; data-section-id=&quot;1p49zt9&quot; data-ke-size=&quot;size26&quot;&gt;오늘의 회고&lt;/h2&gt;
&lt;p data-end=&quot;3898&quot; data-start=&quot;3805&quot; data-ke-size=&quot;size16&quot;&gt;오늘은 선형회귀의 전체 흐름을 직접 실습하면서, 단순히 모델을 만드는 것보다 &lt;b&gt;데이터 형태, 함수명, 매개변수 이름&lt;/b&gt;을 정확히 쓰는 것이 중요하다는 것을 느꼈다.&lt;/p&gt;
&lt;p data-end=&quot;3999&quot; data-start=&quot;3900&quot; data-ke-size=&quot;size16&quot;&gt;특히 X는 머신러닝 모델의 입력값이라 2차원 형태로 준비해야 하고, coef_, intercept_를 통해 모델이 만든 회귀식을 직접 해석할 수 있다는 점이 중요했다.&lt;/p&gt;
&lt;p data-is-only-node=&quot;&quot; data-is-last-node=&quot;&quot; data-end=&quot;4136&quot; data-start=&quot;4001&quot; data-ke-size=&quot;size16&quot;&gt;또한 MSE, RMSE, MAE, R&amp;sup2;는 회귀 모델을 평가할 때 각각 다른 관점에서 모델 성능을 보여주기 때문에, 앞으로 회귀분석을 할 때는 단순히 예측만 하는 것이 아니라 &lt;b&gt;모델이 얼마나 잘 맞는지 평가하는 과정까지 함께 진행해야겠다.&lt;/b&gt;&lt;/p&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/48</guid>
      <comments>https://ideas30180.tistory.com/48#entry48comment</comments>
      <pubDate>Tue, 30 Jun 2026 20:05:40 +0900</pubDate>
    </item>
    <item>
      <title>QAQC본캠프 33일차</title>
      <link>https://ideas30180.tistory.com/47</link>
      <description>&lt;h3 data-end=&quot;255&quot; data-start=&quot;242&quot; data-section-id=&quot;1trilof&quot; data-ke-size=&quot;size23&quot;&gt;1. 선형회귀란?&lt;/h3&gt;
&lt;p data-end=&quot;305&quot; data-start=&quot;257&quot; data-ke-size=&quot;size16&quot;&gt;선형회귀는 독립변수 X와 종속변수 Y 사이의 관계를 직선으로 표현하는 방법이다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;ini&quot;&gt;&lt;code&gt;Y = wX + b&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;408&quot; data-start=&quot;331&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;358&quot; data-start=&quot;331&quot; data-section-id=&quot;14qjl8j&quot;&gt;X: 독립변수 / 원인 변수 / 설명 변수&lt;/li&gt;
&lt;li data-end=&quot;378&quot; data-start=&quot;359&quot; data-section-id=&quot;lr957k&quot;&gt;Y: 종속변수 / 결과 변수&lt;/li&gt;
&lt;li data-end=&quot;394&quot; data-start=&quot;379&quot; data-section-id=&quot;1rfhee0&quot;&gt;w: 가중치, 기울기&lt;/li&gt;
&lt;li data-end=&quot;408&quot; data-start=&quot;395&quot; data-section-id=&quot;10hhycx&quot;&gt;b: 편향, 절편&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-end=&quot;442&quot; data-start=&quot;410&quot; data-ke-size=&quot;size16&quot;&gt;즉, X값이 주어졌을 때 Y값을 예측하는 모델이다.&lt;/p&gt;
&lt;hr data-end=&quot;447&quot; data-start=&quot;444&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h3 data-end=&quot;468&quot; data-start=&quot;449&quot; data-section-id=&quot;y1unim&quot; data-ke-size=&quot;size23&quot;&gt;2. 좋은 직선을 찾는 기준&lt;/h3&gt;
&lt;p data-end=&quot;534&quot; data-start=&quot;470&quot; data-ke-size=&quot;size16&quot;&gt;데이터 점들을 아무 직선으로 연결하는 것이 아니라, &lt;b&gt;실제값과 예측값의 차이&lt;/b&gt;가 가장 작은 직선을 찾아야 한다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;subunit&quot;&gt;&lt;code&gt;Error = 실제값 - 예측값&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;610&quot; data-start=&quot;567&quot; data-ke-size=&quot;size16&quot;&gt;하지만 오차는 양수와 음수가 섞이기 때문에 그냥 더하면 서로 상쇄될 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;636&quot; data-start=&quot;612&quot; data-ke-size=&quot;size16&quot;&gt;그래서 오차를 제곱해서 모두 양수로 만든다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;fix&quot;&gt;&lt;code&gt;오차 제곱 = Error&amp;sup2;&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;hr data-end=&quot;669&quot; data-start=&quot;666&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h3 data-end=&quot;688&quot; data-start=&quot;671&quot; data-section-id=&quot;k3d46u&quot; data-ke-size=&quot;size23&quot;&gt;3. 에러를 줄이는 과정&lt;/h3&gt;
&lt;p data-end=&quot;708&quot; data-start=&quot;690&quot; data-ke-size=&quot;size16&quot;&gt;선형회귀의 핵심은 결국 이것이다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;gauss&quot;&gt;&lt;code&gt;예측값과 실제값의 차이인 Error를 최소화하는 직선을 찾는 것&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;829&quot; data-start=&quot;759&quot; data-ke-size=&quot;size16&quot;&gt;데이터가 많아지면 오차의 총합도 자연스럽게 커질 수 있기 때문에, 전체 오차를 데이터 개수로 나누어 평균적인 오차를 계산한다.&lt;/p&gt;
&lt;p data-end=&quot;874&quot; data-start=&quot;831&quot; data-ke-size=&quot;size16&quot;&gt;이 개념이 나중에 &lt;b&gt;MSE, RMSE 같은 회귀 평가 지표&lt;/b&gt;로 연결된다.&lt;/p&gt;
&lt;hr data-end=&quot;879&quot; data-start=&quot;876&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;889&quot; data-start=&quot;881&quot; data-section-id=&quot;sg2lg8&quot; data-ke-size=&quot;size26&quot;&gt;예시 해석&lt;/h2&gt;
&lt;p data-end=&quot;944&quot; data-start=&quot;891&quot; data-ke-size=&quot;size16&quot;&gt;자료에서는 몸무게와 키 데이터를 이용해 선형회귀식을 만들면 다음과 같은 식이 나온다고 설명했다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;angelscript&quot;&gt;&lt;code&gt;y = 0.86x + 109.37&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;997&quot; data-start=&quot;978&quot; data-ke-size=&quot;size16&quot;&gt;이 식은 다음처럼 해석할 수 있다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;angelscript&quot;&gt;&lt;code&gt;몸무게가 1kg 증가할 때마다 키는 약 0.86cm 증가하는 경향이 있다.&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-end=&quot;1127&quot; data-start=&quot;1054&quot; data-ke-size=&quot;size16&quot;&gt;여기서 중요한 점은 이 식이 모든 데이터를 완벽하게 맞추는 것이 아니라, &lt;b&gt;전체 데이터를 가장 잘 설명하는 직선&lt;/b&gt;이라는 것이다.&lt;/p&gt;
&lt;hr data-end=&quot;1132&quot; data-start=&quot;1129&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;1145&quot; data-start=&quot;1134&quot; data-section-id=&quot;1x5yzsp&quot; data-ke-size=&quot;size26&quot;&gt;오늘의 인사이트&lt;/h2&gt;
&lt;p data-end=&quot;1211&quot; data-start=&quot;1147&quot; data-ke-size=&quot;size16&quot;&gt;선형회귀는 단순히 직선을 긋는 것이 아니라, &lt;b&gt;오차를 최소화하는 방향으로 가장 적절한 관계식을 찾는 과정&lt;/b&gt;이다.&lt;/p&gt;
&lt;p data-end=&quot;1287&quot; data-start=&quot;1213&quot; data-ke-size=&quot;size16&quot;&gt;머신러닝 관점에서는 w와 b를 잘 찾는 것이 핵심이고, 이 가중치를 찾는 과정이 이후 머신러닝 학습의 중요한 원리로 이어진다.&lt;/p&gt;
&lt;hr data-end=&quot;1292&quot; data-start=&quot;1289&quot; data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;1303&quot; data-start=&quot;1294&quot; data-section-id=&quot;1039vok&quot; data-ke-size=&quot;size26&quot;&gt;한 줄 정리&lt;/h2&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;
&lt;pre class=&quot;tp&quot;&gt;&lt;code&gt;선형회귀는 X와 Y의 관계를 직선으로 표현하고, 실제값과 예측값의 오차가 가장 작아지는 직선을 찾는 방법이다.&lt;/code&gt;&lt;/pre&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/47</guid>
      <comments>https://ideas30180.tistory.com/47#entry47comment</comments>
      <pubDate>Mon, 29 Jun 2026 16:21:24 +0900</pubDate>
    </item>
    <item>
      <title>QAQC본캠프 32일차</title>
      <link>https://ideas30180.tistory.com/46</link>
      <description>&lt;h3 data-ke-size=&quot;size23&quot;&gt;Extreme&amp;nbsp;Studentized&amp;nbsp;Deviation(ESD)&amp;nbsp;이용한&amp;nbsp;이상치&amp;nbsp;발견&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터가&amp;nbsp;정규분포를&amp;nbsp;따른다고&amp;nbsp;가정할&amp;nbsp;때,&amp;nbsp;평균에서&amp;nbsp;표준편차의&amp;nbsp;3배&amp;nbsp;이상&amp;nbsp;떨어진&amp;nbsp;값 &lt;br /&gt;모든&amp;nbsp;데이터가&amp;nbsp;정규&amp;nbsp;분포를&amp;nbsp;따르지&amp;nbsp;않을&amp;nbsp;수&amp;nbsp;있기&amp;nbsp;때문에&amp;nbsp;다음&amp;nbsp;상황에서는&amp;nbsp;제한됨&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;IQR(Inter&amp;nbsp;Quantile&amp;nbsp;Range)를&amp;nbsp;이용한&amp;nbsp;이상치&amp;nbsp;발견&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ESD와&amp;nbsp;동일하게&amp;nbsp;데이터가&amp;nbsp;비대칭적이거나&amp;nbsp;샘플사이즈가&amp;nbsp;작은&amp;nbsp;경우&amp;nbsp;제한됨&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Box&amp;nbsp;plot:&amp;nbsp;데이터의&amp;nbsp;사분위&amp;nbsp;수를&amp;nbsp;포함하여&amp;nbsp;분포를&amp;nbsp;보여주는&amp;nbsp;시각화&amp;nbsp;그래프,&amp;nbsp;상자-수염&amp;nbsp;그림이라고도&amp;nbsp;함&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;이상치가 분포에 크게 어긋나는 특이한 데이터라면, 결측치(Missing Value)는 존재하지 않는 데이터이다.&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;수치형&amp;nbsp;데이터&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;평균&amp;nbsp;값&amp;nbsp;대치:&amp;nbsp;대표적인&amp;nbsp;대치&amp;nbsp;방법 &lt;br /&gt;중앙값&amp;nbsp;대치:&amp;nbsp;데이터에&amp;nbsp;이상치가&amp;nbsp;많아&amp;nbsp;평균&amp;nbsp;값이&amp;nbsp;대표성이&amp;nbsp;없다면&amp;nbsp;중앙&amp;nbsp;값을&amp;nbsp;이용 &lt;br /&gt;Ex)&amp;nbsp;이상치는&amp;nbsp;평균&amp;nbsp;값을&amp;nbsp;흔들리게&amp;nbsp;함&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;범주형&amp;nbsp;데이터&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최빈값&amp;nbsp;대치&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;사용&amp;nbsp;함수&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;df.dropna(axis&amp;nbsp;=&amp;nbsp;0):&amp;nbsp;행&amp;nbsp;삭제 &lt;br /&gt;df.dropna(axis&amp;nbsp;=&amp;nbsp;1):&amp;nbsp;열&amp;nbsp;삭제 &lt;br /&gt;Boolean&amp;nbsp;Indexing &lt;br /&gt;df.fillna(value):&amp;nbsp;특정&amp;nbsp;값으로&amp;nbsp;대치(평균,&amp;nbsp;중앙,&amp;nbsp;최빈값) &lt;br /&gt;알고리즘을&amp;nbsp;이용 &lt;br /&gt;sklearn.impute.SimpleImputer:평균,&amp;nbsp;중앙,&amp;nbsp;최빈값으로&amp;nbsp;대치 &lt;br /&gt;SimpleImputer.statistics_&amp;nbsp;:&amp;nbsp;대치한&amp;nbsp;값&amp;nbsp;확인&amp;nbsp;가능 &lt;br /&gt;sklearn.impute.IterativeImputer:&amp;nbsp;다변량대치(회귀&amp;nbsp;대치) &lt;br /&gt;sklearn.impute.KNNImputer:&amp;nbsp;KNN&amp;nbsp;알고리즘을&amp;nbsp;이용한&amp;nbsp;대치&lt;/p&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/46</guid>
      <comments>https://ideas30180.tistory.com/46#entry46comment</comments>
      <pubDate>Fri, 26 Jun 2026 14:33:22 +0900</pubDate>
    </item>
    <item>
      <title>QAQC본캠프 31일차</title>
      <link>https://ideas30180.tistory.com/45</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;OLTP&amp;nbsp;Database:&lt;/b&gt;&amp;nbsp;OnLine&amp;nbsp;Transaction&amp;nbsp;Processing&amp;nbsp;은&amp;nbsp;온라인&amp;nbsp;뱅킹,쇼핑,&amp;nbsp;주문&amp;nbsp;입력&amp;nbsp;등&amp;nbsp;동시에&amp;nbsp;발생하는&amp;nbsp;다수의&amp;nbsp;트랜잭션(데이터베이스&amp;nbsp;작업의&amp;nbsp;단위)&amp;nbsp;처리&amp;nbsp;유형&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Enterprise&amp;nbsp;Applications:&lt;/b&gt;&amp;nbsp;회사&amp;nbsp;내&amp;nbsp;데이터&amp;nbsp;(ex&amp;nbsp;고객&amp;nbsp;관계&amp;nbsp;데이터,&amp;nbsp;제품&amp;nbsp;마케팅&amp;nbsp;세일즈)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Third&amp;nbsp;-&amp;nbsp;Party:&lt;/b&gt;&amp;nbsp;Google&amp;nbsp;Analytics와&amp;nbsp;같은&amp;nbsp;외부소스에서&amp;nbsp;수집되는&amp;nbsp;데이터&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Web/Log:&lt;/b&gt;&amp;nbsp;사용자의&amp;nbsp;로그데이터&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Data&amp;nbsp;Lake:&lt;/b&gt;&amp;nbsp;원시&amp;nbsp;형태의&amp;nbsp;다양한&amp;nbsp;유형의&amp;nbsp;데이터를&amp;nbsp;저장 &lt;br /&gt;&lt;b&gt;Data&amp;nbsp;Warehouse:&lt;/b&gt;&amp;nbsp;보다&amp;nbsp;구조화된&amp;nbsp;형태로&amp;nbsp;정제된&amp;nbsp;데이터를&amp;nbsp;저장 &lt;br /&gt;&lt;b&gt;Data&amp;nbsp;Marts:&lt;/b&gt;&amp;nbsp;회사의&amp;nbsp;금융,&amp;nbsp;마케팅,&amp;nbsp;영업&amp;nbsp;부서와&amp;nbsp;같이&amp;nbsp;특정&amp;nbsp;조직의&amp;nbsp;목적을&amp;nbsp;위해&amp;nbsp;가공된&amp;nbsp;데이터 &lt;br /&gt;&lt;b&gt;BI/Analytics:&lt;/b&gt;&amp;nbsp;business&amp;nbsp;Intelligence(BI)는&amp;nbsp;의사결정에&amp;nbsp;사용될&amp;nbsp;데이터를&amp;nbsp;수집하고&amp;nbsp;분석하는&amp;nbsp;프로세스&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;회사&amp;nbsp;내&amp;nbsp;데이터가&amp;nbsp;존재한다면&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;SQL&amp;nbsp;혹은&amp;nbsp;Python&amp;nbsp;을&amp;nbsp;통해&amp;nbsp;데이터&amp;nbsp;마트를&amp;nbsp;생성&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;회사&amp;nbsp;내&amp;nbsp;Data가&amp;nbsp;없다면&amp;nbsp;&amp;rarr;&amp;nbsp;데이터&amp;nbsp;수집&amp;nbsp;필요&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;방법1:&amp;nbsp;CSV,&amp;nbsp;EXCEL&amp;nbsp;파일&amp;nbsp;다운로드 &lt;br /&gt;방법2:&amp;nbsp;API를&amp;nbsp;이용한&amp;nbsp;데이터&amp;nbsp;수집 &lt;br /&gt;방법3:&amp;nbsp;Data&amp;nbsp;Crawling&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;countplot:&amp;nbsp;범주형&amp;nbsp;자료의&amp;nbsp;빈도&amp;nbsp;수&amp;nbsp;시각화&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;방법:&amp;nbsp;범주형의&amp;nbsp;데이터의&amp;nbsp;각&amp;nbsp;카테고리별&amp;nbsp;빈도수를&amp;nbsp;나타낼&amp;nbsp;때 &lt;br /&gt;Ex)&amp;nbsp;상점에서&amp;nbsp;판매되는&amp;nbsp;제품의&amp;nbsp;카테고리별&amp;nbsp;판매수&amp;nbsp;파악 &lt;br /&gt;x축:&amp;nbsp;범주형&amp;nbsp;자료 &lt;br /&gt;y축:&amp;nbsp;자료의&amp;nbsp;빈도수&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;barplot:&amp;nbsp;범주형&amp;nbsp;자료의&amp;nbsp;시각화&amp;nbsp;&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;방법:&amp;nbsp;데이터의&amp;nbsp;분포,&amp;nbsp;중앙값,&amp;nbsp;사분위&amp;nbsp;수,&amp;nbsp;이상치&amp;nbsp;등을&amp;nbsp;한눈에&amp;nbsp;표현하고&amp;nbsp;싶을&amp;nbsp;때 &lt;br /&gt;Ex)&amp;nbsp;여러&amp;nbsp;그룹간&amp;nbsp;시험&amp;nbsp;점수&amp;nbsp;분포를&amp;nbsp;비교할&amp;nbsp;때 &lt;br /&gt;x:&amp;nbsp;수치형&amp;nbsp;or&amp;nbsp;범주형 &lt;br /&gt;y:&amp;nbsp;수치형&amp;nbsp;자료&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;histogram:&amp;nbsp;수치형&amp;nbsp;자료&amp;nbsp;빈도&amp;nbsp;시각화&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;방법:&amp;nbsp;연속형&amp;nbsp;분포를&amp;nbsp;나타내고&amp;nbsp;싶을&amp;nbsp;때,&amp;nbsp;데이터가&amp;nbsp;몰려있는&amp;nbsp;구간을&amp;nbsp;파악하기&amp;nbsp;쉬움 &lt;br /&gt;Ex)고객들의&amp;nbsp;연령&amp;nbsp;분포를&amp;nbsp;파악&amp;nbsp;할&amp;nbsp;때 &lt;br /&gt;x축:&amp;nbsp;수치형&amp;nbsp;자료 &lt;br /&gt;y축:&amp;nbsp;자료의&amp;nbsp;빈도수&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;scatterplot:&amp;nbsp;수치형끼리&amp;nbsp;자료의&amp;nbsp;시각화&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;방법:&amp;nbsp;두&amp;nbsp;연속형&amp;nbsp;변수간의&amp;nbsp;관계를&amp;nbsp;시각적으로&amp;nbsp;파악하고&amp;nbsp;싶을&amp;nbsp;때 &lt;br /&gt;Ex)&amp;nbsp;키와&amp;nbsp;몸무게&amp;nbsp;간의&amp;nbsp;관계를&amp;nbsp;나타낼&amp;nbsp;때 &lt;br /&gt;x축:&amp;nbsp;수치형&amp;nbsp;자료 &lt;br /&gt;y축:&amp;nbsp;수치형&amp;nbsp;자료&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;pairplot:&amp;nbsp;전체&amp;nbsp;변수에&amp;nbsp;대한&amp;nbsp;시각화&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;방법:&amp;nbsp;한&amp;nbsp;번에&amp;nbsp;여러&amp;nbsp;개의&amp;nbsp;변수를&amp;nbsp;동시에&amp;nbsp;시각화&amp;nbsp;하고&amp;nbsp;싶을&amp;nbsp;때 &lt;br /&gt;x축:&amp;nbsp;범주형&amp;nbsp;or&amp;nbsp;수치형&amp;nbsp;자료 &lt;br /&gt;y축:&amp;nbsp;범주형&amp;nbsp;or&amp;nbsp;수치형&amp;nbsp;자료 &lt;br /&gt;대각선:&amp;nbsp;히스토그램(분포)&lt;/p&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/45</guid>
      <comments>https://ideas30180.tistory.com/45#entry45comment</comments>
      <pubDate>Thu, 25 Jun 2026 16:07:00 +0900</pubDate>
    </item>
    <item>
      <title>QAQC본캠프 30일차</title>
      <link>https://ideas30180.tistory.com/44</link>
      <description>&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;재현&amp;nbsp;가능성&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;동일한&amp;nbsp;연구나&amp;nbsp;실험을&amp;nbsp;반복했을&amp;nbsp;때&amp;nbsp;일관된&amp;nbsp;결과가&amp;nbsp;나오는지&amp;nbsp;여부.&amp;nbsp;연구의&amp;nbsp;신뢰성을&amp;nbsp;높이는&amp;nbsp;중요한&amp;nbsp;요소 &lt;br /&gt;ex)&amp;nbsp;신약을&amp;nbsp;개발할&amp;nbsp;때&amp;nbsp;실험실에서만&amp;nbsp;효과가&amp;nbsp;있는&amp;nbsp;것이&amp;nbsp;아니라&amp;nbsp;실제&amp;nbsp;상황에서도&amp;nbsp;일관된&amp;nbsp;결과가&amp;nbsp;나온다고&amp;nbsp;믿을&amp;nbsp;수&amp;nbsp;있기&amp;nbsp;때문에&amp;nbsp;개발&amp;nbsp;가능한&amp;nbsp;것 &lt;br /&gt;최근&amp;nbsp;p값에&amp;nbsp;대한&amp;nbsp;논쟁이&amp;nbsp;두드러지고&amp;nbsp;있음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;p값을 사용하지 않는 것이 좋다, 유의수준을 0.05에서 변경하는 것이 좋다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가설검정&amp;nbsp;원리상의&amp;nbsp;문제나&amp;nbsp;가설검정의&amp;nbsp;잘못된&amp;nbsp;사용이&amp;nbsp;낮은&amp;nbsp;재현성으로&amp;nbsp;이어진다는&amp;nbsp;문제&amp;nbsp;발생 &lt;br /&gt;최근&amp;nbsp;논문을&amp;nbsp;다시&amp;nbsp;재현해서&amp;nbsp;실험을&amp;nbsp;해보는데&amp;nbsp;똑같은&amp;nbsp;결과가&amp;nbsp;않나오는&amp;nbsp;사례가&amp;nbsp;많은&amp;hellip;&amp;nbsp;재현성&amp;nbsp;위기가&amp;nbsp;문제가&amp;nbsp;되고&amp;nbsp;있음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;결과가&amp;nbsp;재현되지&amp;nbsp;않는다면&amp;nbsp;해당&amp;nbsp;가설의&amp;nbsp;신뢰도가&amp;nbsp;떨어짐&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;재현성&amp;nbsp;위기의&amp;nbsp;원인은&amp;nbsp;무엇인가~?&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실험 조건을 동일하게 조성하기 어려움&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;완전&amp;nbsp;동일하게&amp;nbsp;다시&amp;nbsp;똑같은&amp;nbsp;실험을&amp;nbsp;수행하는&amp;nbsp;것이&amp;nbsp;쉽지&amp;nbsp;않음 &lt;br /&gt;또한&amp;nbsp;가설검정&amp;nbsp;자체도&amp;nbsp;100%&amp;nbsp;검정력을&amp;nbsp;가진&amp;nbsp;것이&amp;nbsp;아니기&amp;nbsp;때문에&amp;nbsp;오차가&amp;nbsp;나타날&amp;nbsp;수&amp;nbsp;있음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;가설검정&amp;nbsp;사용방법에&amp;nbsp;있어서&amp;nbsp;잘못됨&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;p값이&amp;nbsp;0.05가&amp;nbsp;유도되게끔&amp;nbsp;조작하는&amp;nbsp;것이&amp;nbsp;가능&amp;nbsp;(p해킹) &lt;br /&gt;실제로는&amp;nbsp;통계적으로&amp;nbsp;아무&amp;nbsp;의미가&amp;nbsp;없음에도&amp;nbsp;의미가&amp;nbsp;있다고&amp;nbsp;해버리는&amp;nbsp;1종&amp;nbsp;오류를&amp;nbsp;저지를&amp;nbsp;수&amp;nbsp;있음 &lt;br /&gt;0.05라는&amp;nbsp;것은&amp;nbsp;100번&amp;nbsp;중에&amp;nbsp;5번&amp;nbsp;즉,&amp;nbsp;20번&amp;nbsp;중에&amp;nbsp;1번은&amp;nbsp;귀무가설이&amp;nbsp;옳음에도&amp;nbsp;불구하고&amp;nbsp;기각될&amp;nbsp;수&amp;nbsp;있음 &lt;br /&gt;유의수준으로 통제하는 것이 중요, 하지만,&amp;nbsp;유의수준을&amp;nbsp;너무&amp;nbsp;낮추면&amp;nbsp;&amp;nbsp;베타값이&amp;nbsp;커져버리는&amp;nbsp;문제&amp;nbsp;발생&amp;hellip; &lt;br /&gt;따라서,&amp;nbsp;어떤&amp;nbsp;논문에서는&amp;nbsp;유의수준을&amp;nbsp;0.005로&amp;nbsp;설정하면서&amp;nbsp;데이터&amp;nbsp;수를&amp;nbsp;70%&amp;nbsp;더&amp;nbsp;늘려서&amp;nbsp;베타&amp;nbsp;값도&amp;nbsp;컨트롤&amp;nbsp;하는&amp;nbsp;방향을&amp;nbsp;제안하기도&amp;nbsp;함 &lt;br /&gt;잘못된 가설을 세우더라도 우연히 0.05보다 낮아서 가설이 맞는것처럼 보일 수도 있음. 따라서 가능한 좋은 가설을 세우는게 중요&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;p-해킹&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터&amp;nbsp;분석을&amp;nbsp;반복하여&amp;nbsp;p-값을&amp;nbsp;인위적으로&amp;nbsp;낮추는&amp;nbsp;행위 &lt;br /&gt;유의미한&amp;nbsp;결과를&amp;nbsp;얻기&amp;nbsp;위해&amp;nbsp;다양한&amp;nbsp;변수를&amp;nbsp;시도하거나,&amp;nbsp;데이터를&amp;nbsp;계속해서&amp;nbsp;분석하는&amp;nbsp;등의&amp;nbsp;방법을&amp;nbsp;포함&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;p-해킹은 데이터 분석 결과의 신뢰성을 저하시킬 수 있음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여러&amp;nbsp;가설&amp;nbsp;검정을&amp;nbsp;시도하여&amp;nbsp;유의미한&amp;nbsp;p-값을&amp;nbsp;얻을&amp;nbsp;때까지&amp;nbsp;반복&amp;nbsp;분석하는&amp;nbsp;것을&amp;nbsp;조심 &lt;br /&gt;p-해킹은&amp;nbsp;유의미한&amp;nbsp;결과를&amp;nbsp;얻기&amp;nbsp;위해&amp;nbsp;p-값이&amp;nbsp;0.05&amp;nbsp;이하인&amp;nbsp;결과만&amp;nbsp;선택적으로&amp;nbsp;보고하는&amp;nbsp;행위를&amp;nbsp;조심 &lt;br /&gt;데이터의&amp;nbsp;수를&amp;nbsp;늘리다보니&amp;nbsp;특정&amp;nbsp;데이터&amp;nbsp;수를&amp;nbsp;기록할때&amp;nbsp;잠깐&amp;nbsp;p값이&amp;nbsp;0.05&amp;nbsp;이하를&amp;nbsp;기록함으로&amp;nbsp;이를&amp;nbsp;바탕으로&amp;nbsp;대립가설&amp;nbsp;채택하는&amp;nbsp;것을&amp;nbsp;조심 &lt;br /&gt;즉,&amp;nbsp;결과를&amp;nbsp;보며&amp;nbsp;데이터&amp;nbsp;개수를&amp;nbsp;늘려서는&amp;nbsp;안됨 &lt;br /&gt;다양한&amp;nbsp;상황&amp;nbsp;중에서&amp;nbsp;p값이&amp;nbsp;유리하게&amp;nbsp;나오는&amp;nbsp;상황만&amp;nbsp;선별적으로&amp;nbsp;보고하는&amp;nbsp;것을&amp;nbsp;조심 &lt;br /&gt;다양한&amp;nbsp;변수를&amp;nbsp;건드리며&amp;nbsp;유리한&amp;nbsp;결과가&amp;nbsp;나올&amp;nbsp;때&amp;nbsp;다시&amp;nbsp;처음&amp;nbsp;부터&amp;nbsp;가설을&amp;nbsp;그&amp;nbsp;결과에&amp;nbsp;맞게&amp;nbsp;세우는&amp;nbsp;것 &lt;br /&gt;즉,&amp;nbsp;마음에&amp;nbsp;드는&amp;nbsp;상황만&amp;nbsp;골라서&amp;nbsp;보고해서도&amp;nbsp;안됨.&amp;nbsp;모든&amp;nbsp;결과를&amp;nbsp;다보고하거나&amp;nbsp;더&amp;nbsp;엄격한&amp;nbsp;추가실&amp;nbsp;험을&amp;nbsp;수행 &lt;br /&gt;가능한&amp;nbsp;가설을&amp;nbsp;미리&amp;nbsp;세우고&amp;nbsp;검증하는&amp;nbsp;가설검증형&amp;nbsp;방식으로&amp;nbsp;분석을&amp;nbsp;해야&amp;nbsp;하며&amp;nbsp;만약&amp;nbsp;탐색적으로&amp;nbsp;분석한&amp;nbsp;경우&amp;nbsp;가능한&amp;nbsp;모든&amp;nbsp;변수를&amp;nbsp;보고하고&amp;nbsp;본페로니&amp;nbsp;보정과&amp;nbsp;같은&amp;nbsp;방법을&amp;nbsp;사용해야&amp;nbsp;함&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;선택적&amp;nbsp;보고&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;유의미한&amp;nbsp;결과만을&amp;nbsp;보고하고,&amp;nbsp;유의미하지&amp;nbsp;않은&amp;nbsp;결과는&amp;nbsp;보고하지&amp;nbsp;않는&amp;nbsp;행위 &lt;br /&gt;이는&amp;nbsp;데이터&amp;nbsp;분석의&amp;nbsp;결과를&amp;nbsp;왜곡하고,&amp;nbsp;신뢰성을&amp;nbsp;저하시킴&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;선택적&amp;nbsp;보고는&amp;nbsp;언제&amp;nbsp;조심해야하는가?&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다수의&amp;nbsp;데이터&amp;nbsp;분석&amp;nbsp;중&amp;nbsp;유의미한&amp;nbsp;결과가&amp;nbsp;나온&amp;nbsp;실험만을&amp;nbsp;보고서에&amp;nbsp;작성하여&amp;nbsp;발표&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;미리&amp;nbsp;가설과&amp;nbsp;실험&amp;nbsp;방법등에&amp;nbsp;대해서&amp;nbsp;설정을&amp;nbsp;한다음&amp;nbsp;연구를&amp;nbsp;수행하거나&amp;nbsp;연구하는&amp;nbsp;동안&amp;nbsp;얻어진&amp;nbsp;모든&amp;nbsp;변수와&amp;nbsp;결과에&amp;nbsp;대해서&amp;nbsp;공개하지&amp;nbsp;못할&amp;nbsp;때&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;데이터 탐색과 검증 분리&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터&amp;nbsp;탐색을&amp;nbsp;통해&amp;nbsp;가설을&amp;nbsp;설정하고,&amp;nbsp;이를&amp;nbsp;검증하기&amp;nbsp;위해&amp;nbsp;별도의&amp;nbsp;독립된&amp;nbsp;데이터셋을&amp;nbsp;사용하는&amp;nbsp;것 &lt;br /&gt;이는&amp;nbsp;데이터&amp;nbsp;과적합을&amp;nbsp;방지하고&amp;nbsp;결과의&amp;nbsp;신뢰성을&amp;nbsp;높임&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;탐색&amp;nbsp;데이터와&amp;nbsp;검증&amp;nbsp;데이터를&amp;nbsp;히스토그램으로&amp;nbsp;나타냄 &lt;br /&gt;데이터&amp;nbsp;탐색과&amp;nbsp;검증을&amp;nbsp;분리하면&amp;nbsp;탐색&amp;nbsp;과정에서&amp;nbsp;발견된&amp;nbsp;패턴이&amp;nbsp;검증&amp;nbsp;데이터에서도&amp;nbsp;유효한지&amp;nbsp;확인&amp;nbsp;가능 &lt;br /&gt;검증&amp;nbsp;데이터는&amp;nbsp;철저하게&amp;nbsp;탐색&amp;nbsp;데이터와&amp;nbsp;구분되어져야&amp;nbsp;함&lt;/p&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/44</guid>
      <comments>https://ideas30180.tistory.com/44#entry44comment</comments>
      <pubDate>Wed, 24 Jun 2026 19:10:32 +0900</pubDate>
    </item>
    <item>
      <title>QAQC본캠프 29일차</title>
      <link>https://ideas30180.tistory.com/43</link>
      <description>&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;피어슨&amp;nbsp;상관계수&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1280&quot; data-origin-height=&quot;350&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/q5n3u/dJMcahx7Q92/DemuW3ywkPEghJQzvZq1V0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/q5n3u/dJMcahx7Q92/DemuW3ywkPEghJQzvZq1V0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/q5n3u/dJMcahx7Q92/DemuW3ywkPEghJQzvZq1V0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fq5n3u%2FdJMcahx7Q92%2FDemuW3ywkPEghJQzvZq1V0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1280&quot; height=&quot;350&quot; data-origin-width=&quot;1280&quot; data-origin-height=&quot;350&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가장&amp;nbsp;왼쪽&amp;nbsp;그래프가&amp;nbsp;피어슨&amp;nbsp;상관계수&amp;nbsp;그래프! &lt;br /&gt;첫&amp;nbsp;번째&amp;nbsp;그래프는&amp;nbsp;파란색&amp;nbsp;점들로&amp;nbsp;나타내었으며,&amp;nbsp;X와&amp;nbsp;Y의&amp;nbsp;선형&amp;nbsp;관계를&amp;nbsp;보여줍니다. &lt;br /&gt;그래프에서&amp;nbsp;점들이&amp;nbsp;직선적으로&amp;nbsp;퍼져&amp;nbsp;있으며,&amp;nbsp;상관계수는&amp;nbsp;0.99로&amp;nbsp;매우&amp;nbsp;강한&amp;nbsp;양의&amp;nbsp;선형&amp;nbsp;관계를&amp;nbsp;나타냅니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두&amp;nbsp;연속형&amp;nbsp;변수&amp;nbsp;간의&amp;nbsp;선형&amp;nbsp;관계를&amp;nbsp;측정하는&amp;nbsp;지표 &lt;br /&gt;-1에서&amp;nbsp;1&amp;nbsp;사이의&amp;nbsp;값을&amp;nbsp;가지며 &lt;br /&gt;1은&amp;nbsp;완전한&amp;nbsp;양의&amp;nbsp;선형&amp;nbsp;관계 &lt;br /&gt;-1은&amp;nbsp;완전한&amp;nbsp;음의&amp;nbsp;선형&amp;nbsp;관계 &lt;br /&gt;0은&amp;nbsp;선형&amp;nbsp;관계가&amp;nbsp;없음을&amp;nbsp;의미&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;피어슨 상관계수는 언제 사용할까?&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;선형적인&amp;nbsp;관계가&amp;nbsp;예상&amp;nbsp;될&amp;nbsp;때&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;공부&amp;nbsp;시간과&amp;nbsp;시험&amp;nbsp;점수&amp;nbsp;간의&amp;nbsp;상관관계&amp;nbsp;분석&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;비선형&amp;nbsp;관계에선&amp;nbsp;사용할&amp;nbsp;수&amp;nbsp;없음&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;비모수&amp;nbsp;상관계수&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1280&quot; data-origin-height=&quot;350&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/NkwW2/dJMcajin5YH/PvATvzWFFcNkuW84CMUaB0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/NkwW2/dJMcajin5YH/PvATvzWFFcNkuW84CMUaB0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/NkwW2/dJMcajin5YH/PvATvzWFFcNkuW84CMUaB0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FNkwW2%2FdJMcajin5YH%2FPvATvzWFFcNkuW84CMUaB0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1280&quot; height=&quot;350&quot; data-origin-width=&quot;1280&quot; data-origin-height=&quot;350&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두&amp;nbsp;번째&amp;nbsp;그래프가&amp;nbsp;스피어만&amp;nbsp;상관계수&amp;nbsp;그림!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;초록색&amp;nbsp;점들로&amp;nbsp;나타내었으며,&amp;nbsp;X와&amp;nbsp;Y의&amp;nbsp;순위&amp;nbsp;관계를&amp;nbsp;보여줍니다. &lt;br /&gt;스피어만&amp;nbsp;상관계수는&amp;nbsp;두&amp;nbsp;변수의&amp;nbsp;순위&amp;nbsp;간의&amp;nbsp;상관&amp;nbsp;관계를&amp;nbsp;측정합니다. &lt;br /&gt;값은&amp;nbsp;-1에서&amp;nbsp;1&amp;nbsp;사이로&amp;nbsp;해석됩니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;세&amp;nbsp;번째&amp;nbsp;그래프가&amp;nbsp;켄달의&amp;nbsp;타우&amp;nbsp;상관계수&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;빨간색&amp;nbsp;점들로&amp;nbsp;나타내었으며,&amp;nbsp;X와&amp;nbsp;Y의&amp;nbsp;비선형&amp;nbsp;관계를&amp;nbsp;보여줍니다. &lt;br /&gt;켄달의&amp;nbsp;타우는&amp;nbsp;두&amp;nbsp;변수&amp;nbsp;간의&amp;nbsp;순위&amp;nbsp;일관성을&amp;nbsp;측정합니다.&amp;nbsp;비선형&amp;nbsp;관계를&amp;nbsp;탐지하는&amp;nbsp;데&amp;nbsp;유용합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터가&amp;nbsp;정규분포를&amp;nbsp;따르지&amp;nbsp;않거나&amp;nbsp;변수들이&amp;nbsp;순서형&amp;nbsp;데이터일&amp;nbsp;때&amp;nbsp;사용하는&amp;nbsp;상관계수 &lt;br /&gt;데이터의&amp;nbsp;분포에&amp;nbsp;대한&amp;nbsp;가정&amp;nbsp;없이&amp;nbsp;두&amp;nbsp;변수&amp;nbsp;간의&amp;nbsp;상관관계를&amp;nbsp;측정할&amp;nbsp;때&amp;nbsp;사용 &lt;br /&gt;대표적으로&amp;nbsp;스피어만&amp;nbsp;상관계수와&amp;nbsp;켄달의&amp;nbsp;타우&amp;nbsp;상관계수가&amp;nbsp;있음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;가.&amp;nbsp;스피어만&amp;nbsp;상관계수&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두&amp;nbsp;변수의&amp;nbsp;순위&amp;nbsp;간의&amp;nbsp;일관성을&amp;nbsp;측정 &lt;br /&gt;켄달의&amp;nbsp;타우&amp;nbsp;상관계수&amp;nbsp;보다&amp;nbsp;데이터&amp;nbsp;내&amp;nbsp;편차와&amp;nbsp;에러에&amp;nbsp;민감&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;나.&amp;nbsp;켄달의&amp;nbsp;타우&amp;nbsp;상관계수&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;순위&amp;nbsp;간의&amp;nbsp;일치&amp;nbsp;쌍&amp;nbsp;및&amp;nbsp;불일치&amp;nbsp;쌍의&amp;nbsp;비율을&amp;nbsp;바탕으로&amp;nbsp;계산 &lt;br /&gt;ex)&amp;nbsp;예를들어&amp;nbsp;사람의&amp;nbsp;키와&amp;nbsp;몸무게에&amp;nbsp;대해&amp;nbsp;상관계수를&amp;nbsp;알고자&amp;nbsp;할&amp;nbsp;때&amp;nbsp;키가&amp;nbsp;크고&amp;nbsp;몸무게도&amp;nbsp;더&amp;nbsp;나가면&amp;nbsp;일치&amp;nbsp;쌍에&amp;nbsp;해당,&amp;nbsp;키가&amp;nbsp;크지만&amp;nbsp;몸무게가&amp;nbsp;더&amp;nbsp;적으면&amp;nbsp;불일치&amp;nbsp;쌍에&amp;nbsp;해당&amp;nbsp;이들의&amp;nbsp;개수&amp;nbsp;비율로&amp;nbsp;상관계수를&amp;nbsp;결정&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;비모수&amp;nbsp;상관계수는&amp;nbsp;언제&amp;nbsp;사용할까?&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터의 분포에 대한 가정을 하지 못할 때&lt;br /&gt;순서형 데이터에서도 사용하고 싶을 때&lt;/p&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/43</guid>
      <comments>https://ideas30180.tistory.com/43#entry43comment</comments>
      <pubDate>Tue, 23 Jun 2026 19:19:46 +0900</pubDate>
    </item>
    <item>
      <title>QAQC본캠프 28일차</title>
      <link>https://ideas30180.tistory.com/42</link>
      <description>&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;단순선형회귀&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하나의 독립 변수(X)와 하나의 종속 변수(Y) 간의 관계를 직선으로 모델링하는 방법.&lt;br /&gt;☑️&amp;nbsp;회귀식 &lt;br /&gt;Y&amp;nbsp;=&amp;nbsp;&amp;beta;0&amp;nbsp;+&amp;nbsp;&amp;beta;1X,&amp;nbsp;여기서&amp;nbsp;&amp;beta;0는&amp;nbsp;절편,&amp;nbsp;&amp;beta;1는&amp;nbsp;기울기 &lt;br /&gt;중학교&amp;nbsp;때&amp;nbsp;배웠던&amp;nbsp;1차함수를&amp;nbsp;생각하면&amp;nbsp;이해하기&amp;nbsp;쉬움! &lt;br /&gt;☑️&amp;nbsp;특징 &lt;br /&gt;독립&amp;nbsp;변수의&amp;nbsp;변화에&amp;nbsp;따라&amp;nbsp;종속&amp;nbsp;변수가&amp;nbsp;어떻게&amp;nbsp;변화하는지&amp;nbsp;설명하고&amp;nbsp;예측. &lt;br /&gt;데이터가&amp;nbsp;직선적&amp;nbsp;경향을&amp;nbsp;따를&amp;nbsp;때&amp;nbsp;사용합니다. &lt;br /&gt;간단하고&amp;nbsp;해석이&amp;nbsp;용이합니다. &lt;br /&gt;데이터가&amp;nbsp;선형적이지&amp;nbsp;않을&amp;nbsp;경우&amp;nbsp;적합하지&amp;nbsp;않습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;단순선형회귀는&amp;nbsp;어떨&amp;nbsp;때&amp;nbsp;사용할까?&lt;/b&gt; &lt;br /&gt;☑️&amp;nbsp;하나의&amp;nbsp;독립변수와&amp;nbsp;종속변수와의&amp;nbsp;관계를&amp;nbsp;분석&amp;nbsp;및&amp;nbsp;예측 &lt;br /&gt;광고비(X)와&amp;nbsp;매출(Y)&amp;nbsp;간의&amp;nbsp;관계&amp;nbsp;분석. &lt;br /&gt;현재의&amp;nbsp;광고비를&amp;nbsp;바탕으로&amp;nbsp;예상되는&amp;nbsp;매출을&amp;nbsp;예측&amp;nbsp;가능.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;다중선형회귀&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 개 이상의 독립 변수(X1, X2, ..., Xn)와 하나의 종속 변수(Y) 간의 관계를 모델링.&lt;br /&gt;☑️&amp;nbsp;회귀식 &lt;br /&gt;Y&amp;nbsp;=&amp;nbsp;&amp;beta;0&amp;nbsp;+&amp;nbsp;&amp;beta;1X1&amp;nbsp;+&amp;nbsp;&amp;beta;2X2&amp;nbsp;+&amp;nbsp;...&amp;nbsp;+&amp;nbsp;&amp;beta;nXn &lt;br /&gt;☑️&amp;nbsp;특징 &lt;br /&gt;여러&amp;nbsp;독립&amp;nbsp;변수의&amp;nbsp;변화를&amp;nbsp;고려하여&amp;nbsp;종속&amp;nbsp;변수를&amp;nbsp;설명하고&amp;nbsp;예측 &lt;br /&gt;종속변수에&amp;nbsp;영향을&amp;nbsp;미치는&amp;nbsp;여러&amp;nbsp;독립변수가&amp;nbsp;있을&amp;nbsp;때&amp;nbsp;사용합니다. &lt;br /&gt;여러&amp;nbsp;변수의&amp;nbsp;영향을&amp;nbsp;동시에&amp;nbsp;분석할&amp;nbsp;수&amp;nbsp;있습니다. &lt;br /&gt;변수들 간의 다중공선성 문제가 발생할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;다중공선성(Multicollinearity)은 회귀분석에서 독립 변수들 간에 높은 상관관계가 있는 경우를 말합니다.&lt;/span&gt;&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;이는 회귀분석 모델의 성능과 해석에 여러 가지 문제를 일으킬 수 있습니다.&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;독립&amp;nbsp;변수들이&amp;nbsp;서로&amp;nbsp;강하게&amp;nbsp;상관되어&amp;nbsp;있으면,&amp;nbsp;각&amp;nbsp;변수의&amp;nbsp;개별적인&amp;nbsp;효과를&amp;nbsp;분리해내기&amp;nbsp;어려워져&amp;nbsp;회귀의&amp;nbsp;해석을&amp;nbsp;어렵게&amp;nbsp;만듭니다. &lt;br /&gt;다중공선성으로&amp;nbsp;인해&amp;nbsp;실제로&amp;nbsp;중요한&amp;nbsp;변수가&amp;nbsp;통계적으로&amp;nbsp;유의하지&amp;nbsp;않게&amp;nbsp;나타날&amp;nbsp;수&amp;nbsp;있습니다.&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;가장&amp;nbsp;간단한&amp;nbsp;방법으로는&amp;nbsp;상관계수를&amp;nbsp;계산하여&amp;nbsp;상관계수가&amp;nbsp;높은(약&amp;nbsp;0.7)&amp;nbsp;변수들이&amp;nbsp;있는지&amp;nbsp;확인해볼&amp;nbsp;수&amp;nbsp;있습니다. &lt;br /&gt;더&amp;nbsp;정확한&amp;nbsp;방법으로는&amp;nbsp;분산&amp;nbsp;팽창&amp;nbsp;계수&amp;nbsp;(VIF)를&amp;nbsp;계산하여&amp;nbsp;VIF값이&amp;nbsp;10이&amp;nbsp;높은지&amp;nbsp;확인하는&amp;nbsp;방법으로&amp;nbsp;다중공선성이&amp;nbsp;높다고&amp;nbsp;판단할&amp;nbsp;수&amp;nbsp;있습니다.&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;다중공선성 해결 방법&lt;/span&gt;&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;가장&amp;nbsp;간단한&amp;nbsp;방법으로는&amp;nbsp;높은&amp;nbsp;계수를&amp;nbsp;가진&amp;nbsp;변수&amp;nbsp;중&amp;nbsp;하나를&amp;nbsp;제거하는&amp;nbsp;것입니다. &lt;br /&gt;혹은&amp;nbsp;주성분&amp;nbsp;분석(PCA)과&amp;nbsp;같은&amp;nbsp;변수들을&amp;nbsp;효과적으로&amp;nbsp;줄이는&amp;nbsp;차원&amp;nbsp;분석&amp;nbsp;방법을&amp;nbsp;적용하여&amp;nbsp;해결할&amp;nbsp;수도&amp;nbsp;있습니다.&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;다중선형회귀는&amp;nbsp;어떨&amp;nbsp;때&amp;nbsp;사용할까?&lt;/span&gt;&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;다양한&amp;nbsp;광고비(TV,&amp;nbsp;Radio,&amp;nbsp;Newspaper)과&amp;nbsp;매출&amp;nbsp;간의&amp;nbsp;관계&amp;nbsp;분석. &lt;br /&gt;현재의&amp;nbsp;광고비(TV,&amp;nbsp;Radio,&amp;nbsp;Newspaper)를&amp;nbsp;바탕으로&amp;nbsp;예상되는&amp;nbsp;매출을&amp;nbsp;예측&amp;nbsp;가능.&lt;/span&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;&lt;/span&gt;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;범주형&amp;nbsp;변수&amp;nbsp;종류&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;예를&amp;nbsp;들어&amp;nbsp;성별(남,&amp;nbsp;여),&amp;nbsp;지역(도시,&amp;nbsp;시골)&amp;nbsp;등이&amp;nbsp;있으며,&amp;nbsp;더미&amp;nbsp;변수로&amp;nbsp;변환하여&amp;nbsp;회귀&amp;nbsp;분석에&amp;nbsp;사용.&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;옷의&amp;nbsp;사이즈&amp;nbsp;(L,&amp;nbsp;M,&amp;nbsp;&amp;hellip;),&amp;nbsp;수능&amp;nbsp;등급&amp;nbsp;(1등급,&amp;nbsp;2등급,&amp;nbsp;&amp;hellip;.)과&amp;nbsp;같이&amp;nbsp;범주형&amp;nbsp;변수라도&amp;nbsp;순서가&amp;nbsp;있는&amp;nbsp;변수에&amp;nbsp;해당한다&lt;/b&gt; &lt;br /&gt;이런&amp;nbsp;경우&amp;nbsp;각&amp;nbsp;문자를&amp;nbsp;임의의&amp;nbsp;숫자로&amp;nbsp;변환해도&amp;nbsp;문제가&amp;nbsp;없다&amp;nbsp;(순서가&amp;nbsp;잘&amp;nbsp;반영될&amp;nbsp;수&amp;nbsp;있게&amp;nbsp;숫자로&amp;nbsp;변환) &lt;br /&gt;ex)&amp;nbsp;XL&amp;nbsp;&amp;rarr;&amp;nbsp;3,&amp;nbsp;L&amp;nbsp;&amp;rarr;&amp;nbsp;2,&amp;nbsp;M&amp;nbsp;&amp;rarr;&amp;nbsp;1,&amp;nbsp;S&amp;nbsp;&amp;rarr;&amp;nbsp;0&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;성별&amp;nbsp;(남,여),&amp;nbsp;지역&amp;nbsp;(부산,&amp;nbsp;대구,&amp;nbsp;대전,&amp;nbsp;&amp;hellip;)&amp;nbsp;과&amp;nbsp;같이&amp;nbsp;순서가&amp;nbsp;없는&amp;nbsp;변수에&amp;nbsp;해당한다&lt;/b&gt; &lt;br /&gt;2개&amp;nbsp;밖에&amp;nbsp;없는&amp;nbsp;경우&amp;nbsp;임의의&amp;nbsp;숫자로&amp;nbsp;바로&amp;nbsp;변환해도&amp;nbsp;문제가&amp;nbsp;없지만 &lt;br /&gt;3개&amp;nbsp;이상인&amp;nbsp;경우에는&amp;nbsp;무조건&amp;nbsp;원-핫&amp;nbsp;인코딩(하나만&amp;nbsp;1이고&amp;nbsp;나머지는&amp;nbsp;0인&amp;nbsp;벡터)변환을&amp;nbsp;해주어야&amp;nbsp;한다&amp;nbsp;&amp;rarr;&amp;nbsp;pandas의&amp;nbsp;get_dummies를&amp;nbsp;활용하여&amp;nbsp;쉽게&amp;nbsp;구현&amp;nbsp;가능 &lt;br /&gt;ex)&amp;nbsp;부산&amp;nbsp;=&amp;nbsp;[1,0,0,0],&amp;nbsp;대전&amp;nbsp;=&amp;nbsp;[0,1,0,0],&amp;nbsp;대구&amp;nbsp;=&amp;nbsp;[0,0,1,0],&amp;nbsp;광주&amp;nbsp;=&amp;nbsp;[0,0,0,1]&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;범주형&amp;nbsp;변수는&amp;nbsp;어떻게&amp;nbsp;사용할까?&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;성별,&amp;nbsp;근무&amp;nbsp;경력과&amp;nbsp;연봉&amp;nbsp;간의&amp;nbsp;관계. &lt;br /&gt;성별과&amp;nbsp;근무&amp;nbsp;경력이라는&amp;nbsp;요인변수&amp;nbsp;중&amp;nbsp;성별이&amp;nbsp;범주형&amp;nbsp;요인변수에&amp;nbsp;해당 &lt;br /&gt;해당&amp;nbsp;변수를&amp;nbsp;더미&amp;nbsp;변수로&amp;nbsp;변환 &lt;br /&gt;회귀&amp;nbsp;수행&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;다항회귀&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;독립&amp;nbsp;변수와&amp;nbsp;종속&amp;nbsp;변수&amp;nbsp;간의&amp;nbsp;관계가&amp;nbsp;선형이&amp;nbsp;아닐&amp;nbsp;때&amp;nbsp;사용.&amp;nbsp;독립&amp;nbsp;변수의&amp;nbsp;다항식을&amp;nbsp;사용하여&amp;nbsp;종속&amp;nbsp;변수를&amp;nbsp;예측. &lt;br /&gt;데이터가&amp;nbsp;곡선적&amp;nbsp;경향을&amp;nbsp;따를&amp;nbsp;때&amp;nbsp;사용합니다. &lt;br /&gt;비선형&amp;nbsp;관계를&amp;nbsp;모델링할&amp;nbsp;수&amp;nbsp;있습니다. &lt;br /&gt;고차&amp;nbsp;다항식의&amp;nbsp;경우&amp;nbsp;과적합(overfitting)&amp;nbsp;위험이&amp;nbsp;있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;다항회귀는&amp;nbsp;어떨&amp;nbsp;때&amp;nbsp;사용할까?&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;독립변수와&amp;nbsp;종속변수의&amp;nbsp;관계가&amp;nbsp;비선형&amp;nbsp;관계일&amp;nbsp;때&amp;nbsp;사용&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;주택&amp;nbsp;가격&amp;nbsp;예측(면적과&amp;nbsp;가격&amp;nbsp;간의&amp;nbsp;비선형&amp;nbsp;관계)&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;스플라인&amp;nbsp;회귀&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;독립&amp;nbsp;변수의&amp;nbsp;구간별로&amp;nbsp;다른&amp;nbsp;회귀식을&amp;nbsp;적용하여&amp;nbsp;복잡한&amp;nbsp;관계를&amp;nbsp;모델링 &lt;br /&gt;구간마다&amp;nbsp;다른&amp;nbsp;다항식을&amp;nbsp;사용하여&amp;nbsp;전체적으로&amp;nbsp;매끄러운&amp;nbsp;곡선을&amp;nbsp;생성합니다. &lt;br /&gt;데이터가&amp;nbsp;국부적으로&amp;nbsp;다른&amp;nbsp;패턴을&amp;nbsp;보일&amp;nbsp;때&amp;nbsp;사용합니다. &lt;br /&gt;복잡한&amp;nbsp;비선형&amp;nbsp;관계를&amp;nbsp;유연하게&amp;nbsp;모델링할&amp;nbsp;수&amp;nbsp;있습니다. &lt;br /&gt;적절한&amp;nbsp;매듭점(knots)의&amp;nbsp;선택이&amp;nbsp;중요합니다.&lt;/p&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/42</guid>
      <comments>https://ideas30180.tistory.com/42#entry42comment</comments>
      <pubDate>Mon, 22 Jun 2026 19:23:45 +0900</pubDate>
    </item>
    <item>
      <title>QAQC본캠프 27일차</title>
      <link>https://ideas30180.tistory.com/41</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;새로&amp;nbsp;생긴&amp;nbsp;놀이기구는&amp;nbsp;인기가&amp;nbsp;매우&amp;nbsp;많아&amp;nbsp;줄이&amp;nbsp;끊이질&amp;nbsp;않습니다.&amp;nbsp;이&amp;nbsp;놀이기구의&amp;nbsp;원래&amp;nbsp;이용료는&amp;nbsp;price원&amp;nbsp;인데,&amp;nbsp;놀이기구를&amp;nbsp;N&amp;nbsp;번&amp;nbsp;째&amp;nbsp;이용한다면&amp;nbsp;원래&amp;nbsp;이용료의&amp;nbsp;N배를&amp;nbsp;받기로&amp;nbsp;하였습니다.&amp;nbsp;즉,&amp;nbsp;처음&amp;nbsp;이용료가&amp;nbsp;100이었다면&amp;nbsp;2번째에는&amp;nbsp;200,&amp;nbsp;3번째에는&amp;nbsp;300으로&amp;nbsp;요금이&amp;nbsp;인상됩니다. &lt;br /&gt;놀이기구를&amp;nbsp;count번&amp;nbsp;타게&amp;nbsp;되면&amp;nbsp;현재&amp;nbsp;자신이&amp;nbsp;가지고&amp;nbsp;있는&amp;nbsp;금액에서&amp;nbsp;얼마가&amp;nbsp;모자라는지를&amp;nbsp;return&amp;nbsp;하도록&amp;nbsp;solution&amp;nbsp;함수를&amp;nbsp;완성하세요. &lt;br /&gt;단,&amp;nbsp;금액이&amp;nbsp;부족하지&amp;nbsp;않으면&amp;nbsp;0을&amp;nbsp;return&amp;nbsp;하세요.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;def&amp;nbsp;solution(price,&amp;nbsp;money,&amp;nbsp;count):&lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;total&amp;nbsp;=&amp;nbsp;price&amp;nbsp;*&amp;nbsp;count&amp;nbsp;*&amp;nbsp;(count&amp;nbsp;+&amp;nbsp;1)&amp;nbsp;//&amp;nbsp;2&lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;if&amp;nbsp;total&amp;nbsp;&amp;gt;&amp;nbsp;money:&lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;return&amp;nbsp;total&amp;nbsp;-&amp;nbsp;money&lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;else:&lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;return&amp;nbsp;0&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;A/B 테스트&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;A/B&amp;nbsp;검정은&amp;nbsp;두&amp;nbsp;버전(A와&amp;nbsp;B)&amp;nbsp;중&amp;nbsp;어느&amp;nbsp;것이&amp;nbsp;더&amp;nbsp;효과적인지&amp;nbsp;평가하기&amp;nbsp;위해&amp;nbsp;사용되는&amp;nbsp;검정&amp;nbsp;방법. &lt;br /&gt;마케팅,&amp;nbsp;웹사이트&amp;nbsp;디자인&amp;nbsp;등에서&amp;nbsp;많이&amp;nbsp;사용됨. &lt;br /&gt;사용자들을&amp;nbsp;두&amp;nbsp;그룹으로&amp;nbsp;나누고,&amp;nbsp;각&amp;nbsp;그룹에&amp;nbsp;다른&amp;nbsp;버전을&amp;nbsp;제공한&amp;nbsp;후,&amp;nbsp;반응을&amp;nbsp;비교. &lt;br /&gt;일반적으로 전환율, 클릭률, 구매수, 방문 기간, 방문한 페이지 수, 특정 페이지 방문 여부, 매출 등의 지표를 비교.&lt;br /&gt;두&amp;nbsp;그룹&amp;nbsp;간의&amp;nbsp;변화가&amp;nbsp;우연이&amp;nbsp;아니라&amp;nbsp;통계적으로&amp;nbsp;유의미한지를&amp;nbsp;확인.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;가설검정&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;표본&amp;nbsp;데이터를&amp;nbsp;통해&amp;nbsp;모집단의&amp;nbsp;가설을&amp;nbsp;검증하는&amp;nbsp;과정 &lt;br /&gt;즉,&amp;nbsp;데이터가&amp;nbsp;특정&amp;nbsp;가설을&amp;nbsp;지지하는지&amp;nbsp;평가하는&amp;nbsp;과정 &lt;br /&gt;&amp;nbsp;귀무가설(H0)과&amp;nbsp;대립가설(H1)을&amp;nbsp;설정하고,&amp;nbsp;귀무가설을&amp;nbsp;기각할지를&amp;nbsp;결정 &lt;br /&gt;데이터&amp;nbsp;분석시&amp;nbsp;두가지&amp;nbsp;전략을&amp;nbsp;취할&amp;nbsp;수&amp;nbsp;있음 &lt;br /&gt;확증적&amp;nbsp;자료분석 &lt;br /&gt;미리&amp;nbsp;가설들을&amp;nbsp;먼저&amp;nbsp;세운&amp;nbsp;다음&amp;nbsp;가설을&amp;nbsp;검증해&amp;nbsp;나가는&amp;nbsp;분석 &lt;br /&gt;탐색적&amp;nbsp;자료분석(EDA) &lt;br /&gt;가설을&amp;nbsp;먼저&amp;nbsp;정하지&amp;nbsp;않고&amp;nbsp;데이터를&amp;nbsp;탐색해보면서&amp;nbsp;가설&amp;nbsp;후보들을&amp;nbsp;찾고&amp;nbsp;데이터의&amp;nbsp;특징을&amp;nbsp;찾는&amp;nbsp;것&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;다중검정&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여러&amp;nbsp;가설을&amp;nbsp;동시에&amp;nbsp;검정할&amp;nbsp;때&amp;nbsp;발생하는&amp;nbsp;문제 &lt;br /&gt;각&amp;nbsp;검정마다&amp;nbsp;유의수준을&amp;nbsp;조정하지&amp;nbsp;않으면&amp;nbsp;1종&amp;nbsp;오류(귀무가설이&amp;nbsp;참인데&amp;nbsp;기각하는&amp;nbsp;오류)&amp;nbsp;발생&amp;nbsp;확률이&amp;nbsp;증가 &lt;br /&gt;1종&amp;nbsp;오류가&amp;nbsp;무엇인지랑&amp;nbsp;왜&amp;nbsp;다중검정시&amp;nbsp;발생확률이&amp;nbsp;증가하는지는&amp;nbsp;밑에서&amp;nbsp;다시&amp;nbsp;설명!&amp;nbsp;지금은,&amp;nbsp;어떤&amp;nbsp;오류가&amp;nbsp;발생할&amp;nbsp;수&amp;nbsp;있다는&amp;nbsp;정도로&amp;nbsp;이해! &lt;br /&gt;&lt;b&gt;보정 방법&lt;/b&gt; &lt;br /&gt;본페로니&amp;nbsp;보정,&amp;nbsp;튜키&amp;nbsp;보정,&amp;nbsp;던넷&amp;nbsp;보정,&amp;nbsp;윌리엄스&amp;nbsp;보정&amp;nbsp;등이&amp;nbsp;있음 &lt;br /&gt;가장&amp;nbsp;대표적이고&amp;nbsp;기본적인게&amp;nbsp;본페로니&amp;nbsp;보정&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;카이제곱검정&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;범주형&amp;nbsp;데이터의&amp;nbsp;표본&amp;nbsp;분포가&amp;nbsp;모집단&amp;nbsp;분포와&amp;nbsp;일치하는지&amp;nbsp;검정(적합도&amp;nbsp;검정)하거나 &lt;br /&gt;두&amp;nbsp;범주형&amp;nbsp;변수&amp;nbsp;간의&amp;nbsp;독립성을&amp;nbsp;검정(독립성&amp;nbsp;검정) &lt;br /&gt;&lt;b&gt;적합도 검정&lt;/b&gt; &lt;br /&gt;관찰된&amp;nbsp;분포와&amp;nbsp;기대된&amp;nbsp;분포가&amp;nbsp;일치하는지&amp;nbsp;검정 &lt;br /&gt;p값이&amp;nbsp;높으면&amp;nbsp;데이터가&amp;nbsp;귀무&amp;nbsp;가설에&amp;nbsp;잘&amp;nbsp;맞음.&amp;nbsp;즉,&amp;nbsp;관찰된&amp;nbsp;데이터와&amp;nbsp;귀무&amp;nbsp;가설이&amp;nbsp;적합 &lt;br /&gt;p값이&amp;nbsp;낮으면&amp;nbsp;데이터가&amp;nbsp;귀무&amp;nbsp;가설에&amp;nbsp;잘&amp;nbsp;맞지&amp;nbsp;않음.&amp;nbsp;즉,&amp;nbsp;관찰된&amp;nbsp;데이터와&amp;nbsp;귀무&amp;nbsp;가설이&amp;nbsp;부적합 &lt;br /&gt;&lt;b&gt;독립성 검정&lt;/b&gt; &lt;br /&gt;두&amp;nbsp;범주형&amp;nbsp;변수&amp;nbsp;간의&amp;nbsp;독립성을&amp;nbsp;검정 &lt;br /&gt;p값이&amp;nbsp;높으면&amp;nbsp;두&amp;nbsp;변수&amp;nbsp;간의&amp;nbsp;관계가&amp;nbsp;연관성이&amp;nbsp;없음&amp;nbsp;&amp;rarr;&amp;nbsp;독립성이&amp;nbsp;있음 &lt;br /&gt;p값이&amp;nbsp;낮으면&amp;nbsp;두&amp;nbsp;변수&amp;nbsp;간의&amp;nbsp;관계가&amp;nbsp;연관성이&amp;nbsp;있음&amp;nbsp;&amp;rarr;&amp;nbsp;독립성이&amp;nbsp;없음&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div id=&quot;code-block-viewer&quot;&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;</description>
      <author>ideas30180</author>
      <guid isPermaLink="true">https://ideas30180.tistory.com/41</guid>
      <comments>https://ideas30180.tistory.com/41#entry41comment</comments>
      <pubDate>Fri, 19 Jun 2026 19:28:49 +0900</pubDate>
    </item>
  </channel>
</rss>