Chapter 14

수율 학습과 경제성

범인을 잡는 것만으로는 수사가 끝나지 않는다. 얼마나 빨리 잡았는가, 잡는 데 얼마를 썼는가, 잡기 전까지 얼마를 잃었는가가 남는다. 수율 분석은 결국 속도의 문제다. 같은 원인을 한 달 먼저 찾은 공장과 한 달 늦게 찾은 공장은 같은 기술로 전혀 다른 돈을 번다. 이 장은 앞 장들의 도구에 값을 매긴다. 수율이 오르는 속도, 무엇부터 고칠지의 순서, 얼마나 자주 검사할지의 계산, 그리고 경보가 늦게 울린 대가를 다룬다.

수율 램프: 학습 속도가 곧 돈

새 공정이나 새 제품의 수율은 낮게 시작해서 오른다. 1장에서 본 학습 곡선이다. 이 곡선이 오르는 구간을 수율 램프(Yield ramp)라고 한다. 이 장의 첫 물음은 곡선의 모양이 아니라 기울기다. 무엇이 램프의 속도를 정하는가.

수율은 저절로 오르지 않는다. 누군가 결함을 찾고, 원인을 밝히고, 고치고, 고쳐졌는지 확인해야 오른다. 이 한 바퀴가 학습 사이클(Learning cycle)이다. 2장부터 13장까지의 내용 전체가 이 한 바퀴를 도는 방법이었다. 한 바퀴를 돌 때마다 결함 밀도가 일정한 비율로 줄어든다고 보면 램프는 간단한 식이 된다.

$$D(t) = D_\infty + (D_i - D_\infty)\,(1-k)^{\lfloor t/T_c \rfloor}, \qquad Y(t) = e^{-A\,D(t)}$$
\(D_i\)는 처음의 결함 밀도, \(D_\infty\)는 성숙한 공정이 닿는 바닥, \(k\)는 한 사이클에 줄어드는 비율, \(T_c\)는 한 사이클에 걸리는 시간, \(A\)는 다이 면적. 수율 식은 4장의 푸아송 모델이다. 계통 손실도 같은 방식으로 줄어든다고 보고 \(D\) 하나에 묶었다.

식에서 손잡이는 둘뿐이다. 한 바퀴에 얼마나 배우는가(\(k\))와 한 바퀴가 얼마나 짧은가(\(T_c\)). 앞의 것은 분석의 질이고 뒤의 것은 시간이다. 문제는 시간 쪽에 물리적인 바닥이 있다는 점이다. 웨이퍼를 투입해서 웨이퍼 테스트 결과를 받기까지, 공정 단계가 수백 개인 제품은 대략 1.5~3개월이 걸린다. 테스트 결과만 기다린다면 1년에 배울 기회가 네 번에서 여덟 번뿐이다. 그래서 공장은 더 짧은 고리를 여러 겹 만든다.

웨이퍼 투입 트랜지스터 콘택 · 배선 웨이퍼 테스트 조립 · 최종 테스트 1 2 3 고리가 짧을수록1년에 더 여러 번 배운다 1인라인 검사·계측: 수 시간~수 일. 결함은 보이지만 전기적으로 죽는지는 모른다 2단축 루프·테스트 소자: 수 일~수 주. 일부 층만 만들어 전기로 확인한다 3웨이퍼 테스트: 약 1.5~3개월. 답은 확실하지만 가장 늦다
세 겹의 학습 고리. 가장 바깥 고리(웨이퍼 테스트)는 "다이가 죽었는가"에 확실히 답하지만 한 바퀴가 길다. 안쪽 고리는 빠르지만 간접 증거다. 인라인 검사는 결함을 볼 뿐 그것이 치명적인지는 모르고(7장의 치명률), 단축 루프(Short loop)는 실제 제품과 다른 구조를 본다. 램프를 빨리 올리는 공장은 안쪽 고리로 배우고 바깥 고리로 확인한다.

안쪽 고리의 대표가 메모리 배열이다. SRAM은 셀이 규칙적으로 깔려 있어 실패한 비트의 주소가 곧 물리적 위치이고, 실패 모양(한 비트, 한 쌍, 한 행, 한 열)이 결함의 층과 종류를 알려 준다. 그래서 로직 공정도 개발 초기에는 SRAM을 수율 학습의 도구로 쓴다. 스크라이브 라인의 테스트 소자(8장의 PCM)는 배선 몇 층만 올린 상태에서 단선·단락 사슬의 저항을 재서 층별 결함 밀도를 일찍 알려 준다.

늦게 오른 수율은 값이 싸다

램프의 속도가 돈이 되는 이유는 가격이 기다려 주지 않기 때문이다. 반도체 제품의 가격은 출시 직후가 가장 높고, 경쟁 제품이 나오고 다음 세대가 다가오면서 해마다 대략 수십 %씩 내려간다. 양품 다이 하나의 값이 가장 비쌀 때 수율은 가장 낮다. 제품 수명 동안의 수익은 이 두 곡선의 곱을 시간에 대해 더한 것이다.

$$R = \sum_{t} N_w(t)\cdot N_{die}\cdot Y(t)\cdot P(t), \qquad P(t) = P_0\,(1-e)^{t/1\text{년}}$$
\(N_w\)는 그 주에 투입한 웨이퍼 수, \(N_{die}\)는 웨이퍼당 다이 수, \(P(t)\)는 양품 다이의 가격, \(e\)는 연간 가격 하락률. 웨이퍼 원가는 수율과 무관하게 나가므로 수율이 낮은 동안의 웨이퍼는 손해를 보고 만드는 셈이다.
SIMULATOR

램프 곡선과 누적 수익

수율가격주간 수익기준(8주 · 30%)
수율 80% 도달—
2년 뒤 수율—
누적 양품 다이 (주 1장 투입)—
누적 수익 (기준 대비)—
해볼 것: ① 사이클 타임만 8주에서 4주로 줄여 보자. 한 바퀴에 배우는 양은 그대로인데 80% 도달이 절반으로 당겨지고 누적 수익이 크게 는다. 계단 하나가 학습 한 번이다. ② 사이클 타임을 16주, 감소율을 10%로 놓으면 2년이 지나도 80%에 닿지 못한다. 아래 그래프의 수익 봉우리가 낮고 늦다. ③ 가격 하락을 0%로 놓으면 늦은 학습의 벌이 줄고, 60%로 올리면 뒤늦게 오른 수율이 거의 돈이 되지 않는다. ④ 감소율 30%·8주와 감소율 약 16%·4주를 비교해 보자. 반만 배워도 두 배 자주 배우면 비슷하다. (다이 0.52 cm², 결함 밀도 4 → 0.2개/cm², 푸아송 모델. 매주 같은 수의 웨이퍼를 투입하고 만든 양품은 모두 그 주 가격에 팔린다고 가정한 교육용 모델. 수익은 완벽한 수율·첫 주 가격을 100으로 둔 상대값)
수율 1%p의 크기사건 YB-12의 제품은 웨이퍼 한 장에 다이가 1,228개다. 수율 1%p는 웨이퍼당 약 12개, 한 로트(25장)에 약 300개다. 성숙한 공정에서 1%p는 작아 보이지만 웨이퍼 원가는 이미 다 치른 뒤이므로 늘어난 양품은 거의 그대로 이익이다. 수율 엔지니어가 0.5%p짜리 결함 하나를 몇 주씩 쫓는 까닭이다.

결함 파레토와 제한 수율

한 바퀴에 많이 배우려면 가장 큰 손실부터 고쳐야 한다. 7장에서 결함을 종류별로 세어 큰 순서로 늘어놓은 파레토(Pareto chart)를 만들었다. 그런데 그 파레토는 개수의 순위였다. 고칠 순서를 정하려면 개수를 수율로 바꿔야 한다. 결함 종류 하나만 있고 나머지가 완벽하다고 할 때의 수율이 그 결함의 제한 수율(Limited yield)이다.

$$Y = Y_{\text{기타}}\prod_i Y_i, \qquad Y_i = \exp\!\left(-\frac{n_i\,\kappa_i}{N_{die}}\right), \qquad \Delta Y_i = Y\left(\frac{1}{Y_i}-1\right)$$
\(n_i\)는 웨이퍼당 그 종류의 결함 수, \(\kappa_i\)는 치명률(결함 하나가 다이를 죽일 확률), \(N_{die}\)는 웨이퍼당 다이 수. \(\Delta Y_i\)는 그 결함을 완전히 없앴을 때 오르는 수율이다. \(Y_{\text{기타}}\)는 검사에 잡히지 않는 손실을 모은 항이다.

이 식에서 네 가지를 읽는다.

SIMULATOR

파레토 개선: 예산 안에서 무엇부터 고칠까

모델 수율 (제한 수율의 곱)—
이 웨이퍼의 수율—
쓴 공수 / 예산—
예산 안에서 가능한 최고 수율?
해볼 것: ① 아래 버튼(괄호 안이 드는 공수)을 눌러 결함을 하나씩 없앤다. 맵에서 그 색의 불량이 사라지고 수율이 오른다. 막대 오른쪽의 "+%p"는 지금 그 결함을 없애면 오르는 양이다. 다른 결함을 먼저 없앨수록 이 숫자가 커지는 것을 확인하자. ② "검출 결함 수 순"으로 바꾸면 미세 파티클이 1위로 올라온다. 개수가 가장 많지만 없애도 수율은 1%p 남짓 오른다. 반대로 중심 막 두께는 검사에 잡히는 결함이 없어 개수 파레토에는 아예 없다. ③ 예산 6으로 손실 1위(콘택 미개구)부터 고르면 남는 공수로 할 수 있는 일이 거의 없다. "최선의 조합 보기"와 비교하자. 공수당 이득이 큰 것부터 고르는 편이 낫다. ④ 예산을 16까지 늘려도 마지막 몇 공수는 수율을 조금밖에 올리지 못한다. 파레토의 꼬리다. (사건 YB-12와 같은 격자의 가상 웨이퍼. 결함 종류와 숫자는 설명을 위한 것이며, 고치면 그 결함이 완전히 사라진다고 가정한다. 실제로는 일부만 줄어든다.)

파레토는 한 번 그리고 끝나는 그림이 아니다. 1위를 없애면 2위가 1위가 되고, 전에는 묻혀 있던 결함이 순위 안으로 올라온다. 학습 사이클마다 파레토를 다시 그리는 일이 곧 베이스라인 개선이다. 꼬리로 갈수록 한 항목이 주는 이득이 작아지므로 성숙한 공정의 수율 곡선은 평평해진다.

검사 샘플링 계획: 어디를, 얼마나 자주, 몇 장

모든 웨이퍼를 모든 단계 뒤에 검사하면 놓치는 것이 없다. 그렇게 하지 않는 이유는 값이다. 검사 장비는 비싸고 대수가 한정되어 있으며, 검사받는 동안 웨이퍼는 다음 공정으로 가지 못해 사이클 타임이 늘어난다. 검출한 좌표는 리뷰와 분류를 거쳐야 정보가 되는데(7장) 그 일에도 장비와 사람이 든다. 전자빔 검사는 광학보다 수백 배 넘게 느려서 웨이퍼의 일부 면적만 볼 수 있다(6장). 그래서 검사는 표본으로 한다. 샘플링 계획(Sampling plan)은 세 가지 결정이다.

어느 단계 뒤에층과 공정 고르기 공정 흐름 → 검사검사검사검사 몇 로트마다검사 간격 T T = 4로트 로트당 몇 장어느 슬롯인가 12131425 홀수 슬롯은 챔버 A, 짝수 슬롯은 챔버 B. 한쪽만 뽑으면 다른 챔버의 문제는 보이지 않는다.
샘플링 계획의 세 가지 결정. 위: 수백 개 공정 단계 가운데 검사를 넣을 자리. 가운데: 그 자리에서 몇 로트마다 검사할지. 아래: 검사하는 로트에서 몇 장을, 어느 슬롯에서 뽑을지. 굵은 테두리는 뽑은 웨이퍼다. 챔버가 둘인 장비는 슬롯 순서대로 번갈아 처리하므로(12장) 홀수와 짝수를 함께 뽑아야 두 챔버를 모두 본다.
결정정하는 기준늘리면 얻는 것늘리면 드는 것
어느 단계 뒤에치명 결함이 많이 생기는 공정 뒤, 결함이 다음 막에 덮여 안 보이게 되기 전, 재작업이 가능한 마지막 지점(현상 후)층간 추적으로 결함이 생긴 공정을 좁힌다. 문제 공정과 검사 사이의 거리가 짧아진다검사 장비 대수, 사이클 타임
몇 로트마다그 공정의 이상 발생 빈도, 한 번 터졌을 때의 손실 크기이상 발생에서 다음 검사까지 기다리는 시간이 줄어든다검사 횟수에 비례하는 비용
로트당 몇 장, 어느 슬롯앞 공정의 챔버 수와 처리 순서, 로트 안 변동일부 웨이퍼에만 생기는 문제를 잡을 확률이 오른다검사 시간, 리뷰할 결함 수
웨이퍼의 얼마를검사 방식의 처리량(광학은 전면, 전자빔은 일부 면적)국소 무늬(도넛, 군집)를 놓치지 않는다장당 검사 시간

표본이 문제를 볼 확률

이상이 로트의 일부 웨이퍼에만 있을 때, 뽑은 웨이퍼 가운데 문제 웨이퍼가 하나라도 들어 있어야 검사가 그것을 본다. 25장 가운데 \(m\)장이 문제이고 \(n\)장을 무작위로 뽑으면 그 확률은 다음과 같다.

$$p = 1 - \binom{25-m}{n}\bigg/\binom{25}{n}$$
문제 웨이퍼를 하나도 뽑지 못할 확률을 1에서 뺀 것이다(초기하 분포). 뽑힌 문제 웨이퍼에서 검사 장비가 그 결함을 실제로 잡아내는가는 별개의 문제로, 5·6장에서 다룬 포착률이 여기에 곱해진다.

챔버 둘 가운데 하나가 문제여서 12장이 영향을 받았다고 하자. 무작위로 1장만 보면 \(p\) = 12/25 = 48%다. 2장이면 74%, 3장이면 약 88%, 5장이면 약 98%다. 반면 로트에서 1장만 망가지는 문제(반송 스크래치 등)는 5장을 봐도 20%다. 무작위로 뽑지 않고 구조를 알고 뽑으면 훨씬 싸다. 홀수 슬롯 하나와 짝수 슬롯 하나, 두 장이면 두 챔버 문제는 100% 본다. 샘플링 계획은 통계 이전에 장비의 구조를 아는 일이다.

고정 샘플링과 적응 샘플링간격과 장수를 미리 정해 두는 것이 고정 샘플링이다. 운영이 쉽지만 조용한 공정에도 같은 비용을 쓴다. 적응 샘플링은 평소에는 성기게 보다가 경보가 울리거나 장비를 정비한 직후, 새 레시피를 넣은 직후에 촘촘하게 본다. 위험이 큰 때에 검사를 몰아 쓰는 방식이다.

이상 발생의 비용: 검출까지 지나간 웨이퍼

공정이 평소 수준에서 갑자기 벗어나는 사건을 이상 발생(Excursion)이라고 한다. 챔버 부품이 닳아 파티클이 쏟아지거나, 정전척의 온도 구역이 틀어지거나, 레티클에 오염이 자라는 일이다. 이상 발생의 값은 그것이 얼마나 나빴는가보다 얼마나 오래 모르고 있었는가로 정해진다. 발생한 순간부터 장비를 세울 때까지 그 장비를 지나간 웨이퍼가 전부 위험 노출(At-risk) 웨이퍼다.

검사검사 이상 발생위험 노출 웨이퍼장비 정지 ① 다음 검사까지평균 (T+1)/2 로트 ② 결과 지연 d리뷰 · 판단 정상정지 · 원인 조사 · 재가동 지나가는 로트 →
이상 발생의 시간선. 칸 하나가 그 장비를 지나가는 로트 하나다. 이상이 생겨도 다음 검사 차례가 올 때까지는 아무도 모른다(①). 검사한 뒤에도 결과를 리뷰하고 장비를 세우기로 판단할 때까지 로트가 계속 지나간다(②). 검사가 문제를 놓치면 ①이 간격 T만큼 한 번 더 늘어난다. 그 사이의 웨이퍼는 이미 뒤 공정으로 넘어가 있어 대부분 되돌릴 수 없다.

검사 간격이 \(T\)로트이고, 이상 발생이 간격 안의 아무 때나 시작되며, 한 번의 검사가 문제를 볼 확률이 \(p\), 검사 뒤 장비를 세우기까지 \(d\)로트가 더 지나간다고 하면 평균 위험 노출 웨이퍼 수는 다음과 같다.

$$\bar N_{\text{risk}} = m\left[\frac{T+1}{2} + T\,\frac{1-p}{p} + d\right]$$
\(m\)은 로트당 영향받는 웨이퍼 수. 첫 항은 다음 검사까지 기다리는 로트 수의 평균, 둘째 항은 검사가 놓쳐서 되풀이되는 간격, 셋째 항은 결과 지연이다.

\(T\) = 5, \(p\) = 0.74, \(d\) = 2이면 대괄호 안은 3 + 1.8 + 2 ≈ 6.8로트다. 세 항이 모두 비슷한 크기라는 점이 중요하다. 검사를 촘촘히 해도 결과가 늦게 나오거나 표본이 문제를 자주 놓치면 소용이 없다. 이제 검사비를 더한다. 로트 하나가 지날 때마다 드는 평균 비용은 검사비와 이상 발생 손실의 합이다.

$$C(T) = \underbrace{\frac{c_i\,n}{T}}_{\text{검사비}} + \underbrace{\lambda\,L\,\bar N_{\text{risk}}(T)}_{\text{이상 발생 손실}}, \qquad T^{*} = \sqrt{\frac{2\,c_i\,n}{\lambda\,m\,L}\cdot\frac{p}{2-p}}$$
\(c_i\)는 웨이퍼 한 장의 검사비, \(n\)은 로트당 검사 장수, \(\lambda\)는 로트당 이상 발생 확률, \(L\)은 영향받은 웨이퍼 한 장이 잃는 값. \(T^*\)는 \(C\)를 \(T\)로 미분해 0으로 놓은 최적 간격이다.

최적 간격은 제곱근으로 움직인다. 이상 발생이 네 배 잦아지거나 손실이 네 배 커져도 검사는 두 배만 촘촘하게 하면 된다. 반대로 검사비가 네 배인 방식(전자빔)은 간격을 두 배로 벌리는 것이 맞다. 그리고 결과 지연 \(d\)는 \(T^*\)에 들어 있지 않다. 지연은 간격으로 만회할 수 없고 따로 줄여야 하는 고정 손실이다.

SIMULATOR

샘플링 게임: 검사비와 위험 노출의 균형

총비용검사비이상 발생 손실
검사 1회의 검출 확률 p—
평균 위험 노출—
이번 판 / 지금까지 평균—
총비용: 현재 / 최소—
해볼 것: ① "이상 발생!"을 여러 번 누른다. 위쪽 띠에서 붉은 칸이 위험 노출 로트이고, 칸 아래의 짧은 막대가 검사한 로트다. 같은 설정에서도 판마다 운이 다르다. 평균은 식의 값으로 모인다. ② 간격 T를 1에서 20까지 움직이며 아래 그래프의 총비용이 가장 낮은 곳을 찾는다. 왼쪽은 검사비가, 오른쪽은 손실이 지배한다. ③ "1장만"으로 바꾸고 n = 1로 두면 검출 확률이 4%다. 검사를 매 로트 해도 수십 로트가 지나간다. n을 올려 보자. 로트당 검사비는 늘지만 총비용은 오히려 준다. ④ 결과 지연을 10으로 올리면 곡선 전체가 위로 뜬다. 최적 간격은 그대로다. ⑤ 발생 빈도를 4배로 올려도 최적 간격은 절반 정도로만 줄어든다. (비용 단위는 웨이퍼 한 장의 값. 검사비는 장당 0.02, 영향받은 웨이퍼는 값의 15%를 잃는다고 둔 교육용 상대값. 하루 등 일정 시간에 로트 하나가 지나가고, 뽑힌 웨이퍼에 문제가 있으면 검사가 반드시 잡는다고 가정한다. 광학으로 안 보이는 결함이면 p는 0이다.)
지연을 줄이는 다른 길제품 웨이퍼 검사만이 감시 수단은 아니다. 장비 자체의 센서 값(압력, 온도, 고주파 전력, 헬륨 유량)을 웨이퍼마다 감시하는 FDC(Fault detection and classification)는 지연이 사실상 웨이퍼 한 장이다. 패턴 없는 모니터 웨이퍼를 장비에 한 번 통과시켜 늘어난 파티클 수를 세는 방법(Particles per wafer pass)은 제품을 걸지 않고 장비 상태를 본다. 둘 다 "장비가 평소와 다르다"까지만 말해 주고 그것이 수율을 떨어뜨리는지는 말해 주지 않으므로 제품 검사를 대신하지는 못한다.

관리도: 언제 경보를 울릴 것인가

검사를 했다고 문제가 검출되는 것은 아니다. 검사 결과는 숫자이고, 그 숫자가 평소와 다른지를 판단하는 규칙이 있어야 한다. 그 규칙이 관리도(Control chart)다. 통계적 공정 관리(SPC)의 기본 도구로, 평소의 흩어짐을 기준으로 한계선을 긋고 그 밖으로 나가는 점을 신호로 본다. 웨이퍼당 결함 수에는 개수용 관리도(c chart)를 쓴다. 결함이 서로 독립으로 생기면 개수는 푸아송 분포를 따르고 표준편차는 평균의 제곱근이다.

$$\text{UCL} = \bar c + 3\sqrt{\bar c}, \qquad \text{ARL} = \frac{1}{P(\text{한 점이 경보를 울림})}, \qquad \text{ARL}_1 \approx \frac{1}{1-\Phi(3-\delta)}$$
\(\bar c\)는 평소의 평균 결함 수, UCL은 관리 상한. ARL(Average run length)은 경보가 울릴 때까지의 평균 검사 횟수다. 공정이 정상일 때의 ARL₀는 길수록 좋고(오경보 간격), 평균이 \(\delta\sigma\)만큼 올라갔을 때의 ARL₁은 짧을수록 좋다(검출 지연). \(\Phi\)는 표준 정규 분포의 누적 함수. 결함 수는 늘어나는 쪽만 문제이므로 위쪽 한계만 본다.

3σ 한계는 오경보를 드물게 만들려고 고른 값이다. 정상 공정의 점이 위쪽 3σ를 넘을 확률은 약 0.135%이므로 오경보는 평균 740번에 한 번이다. 대가는 둔감함이다. 평균이 3σ만큼 뛰면 평균 두 번의 검사로 잡지만, 1.5σ 변화는 평균 15번, 1σ 변화는 평균 44번이 걸린다. 앞 절의 식으로 보면 검출 확률 \(p\)가 2%인 검사를 하고 있는 셈이다. 작은 변화를 빨리 잡으려면 한 점이 아니라 점들의 흐름을 보는 규칙을 더한다.

규칙경보 조건(위쪽)정상일 때 확률(점당, 약)잘 잡는 것
1한 점이 3σ 밖0.14%큰 변화, 한 장짜리 사고
2연속 3점 중 2점이 2σ 밖0.15%중간 크기의 변화
3연속 5점 중 4점이 1σ 밖0.28%작은 변화의 지속
4연속 8점이 중심선 위0.39%아주 작은 이동, 느린 추세

이 네 가지가 흔히 쓰는 보조 규칙(Western Electric rules)이다. 규칙을 더할수록 작은 변화를 빨리 잡지만 오경보도 는다. 네 규칙을 양쪽으로 모두 쓰면 오경보 간격은 약 370에서 약 90으로 줄어든다. 오경보는 공짜가 아니다. 경보마다 장비를 세우고 확인해야 하며, 헛경보가 잦으면 사람들은 경보를 믿지 않게 된다. 그래서 경보마다 누가 무엇을 확인하고 언제 장비를 세울지를 미리 적어 둔 대응 절차(OCAP, Out-of-control action plan)를 붙인다.

SIMULATOR

결함 수 관리도: 경보 규칙과 검출 지연

정상 판정경보(숫자는 규칙 번호)UCL
중심선 / UCL—
이 계열: 검출 지연 / 오경보—
평균 검출 지연 ARL₁—
평균 오경보 간격 ARL₀—
해볼 것: ① 31번째 검사부터 평균이 δσ만큼 올라간다(σ는 평균의 제곱근). 기본값 1.5σ에서는 규칙 1만으로 평균 15번쯤 걸린다. δ를 3으로 올리면 두세 번 만에, 0.5로 내리면 거의 잡지 못한다. ② 규칙 2, 3, 4를 하나씩 켠다. 검출 지연이 줄고 오경보 간격도 함께 줄어든다. 둘을 따로 움직일 수는 없다. ③ δ를 1로 놓으면 평균 100개인 층에서 결함이 10% 늘어난 경우다. 규칙 1만으로는 평균 40번 넘게 걸린다. 사건 YB-12에서 경보가 울리지 않은 이유다. ④ 실제 산포를 3으로 올린다. 결함이 뭉쳐 나와 개수의 흩어짐이 푸아송보다 큰 경우다. 변화가 없는 앞쪽 30점에서도 경보가 쏟아진다. "한계를 실제 산포로 다시 계산"을 켜면 오경보는 사라지지만 같은 변화가 한계 안에 묻힌다. (점은 웨이퍼 한 장의 결함 수. 평균 지연과 오경보 간격은 정규 근사 난수로 수백 번 돌린 값이어서 대략값이다. 오경보 간격은 4,000번에서 자른다.)
결함 수는 푸아송보다 넓게 흩어진다결함은 뭉쳐서 생긴다(4장의 군집). 스크래치 하나가 좌표 수십 개로 세어지고, 파티클은 소나기처럼 떨어진다. 이런 개수는 분산이 평균보다 크고 음이항 분포에 가깝다. 푸아송을 가정한 한계선은 너무 좁아 오경보가 쏟아진다. 실무에서는 군집을 하나의 사건으로 묶어 센 뒤(7장의 공간 시그니처 분석) 관리도에 올리거나, 실제 데이터의 흩어짐으로 한계를 잡는다. 뒤의 방법은 오경보를 줄이는 대신 감도를 내준다.
총 개수 관리도가 못 보는 것웨이퍼당 결함 수 하나만 보는 관리도는 결함이 "어디에", "어떤 종류로" 늘었는지를 버린다. 평소 100개이던 결함이 110개가 되는 변화는 흩어짐에 묻히지만, 그 늘어난 10개가 전부 같은 종류이거나 같은 자리에 있다면 그것은 뚜렷한 신호다. 그래서 분류된 결함 종류별로 관리도를 따로 두고, 좌표를 샷으로 접은 반복 결함 수(11장)나 구역별 밀도(10장)처럼 공간 정보를 담은 값을 함께 감시한다. 평균의 작은 이동에는 지난 점들을 누적해 보는 EWMA·CUSUM 관리도가 3σ 규칙보다 빠르다.

베이스라인 개선과 이상 발생 제어

수율을 지키는 일은 성격이 다른 두 가지로 나뉜다. 하나는 평소 수준 자체를 끌어올리는 베이스라인 개선(Baseline improvement)이고, 다른 하나는 평소 수준에서 떨어지는 사고를 빨리 잡아 막는 이상 발생 제어(Excursion control)다. 2절의 파레토가 앞의 일이고 3~5절의 샘플링과 관리도가 뒤의 일이다.

수율 →시간 → 깊이폭 = 검출까지 걸린 시간 베이스라인 개선파레토의 맨 위를 없애 곡선 전체를 올린다 이상 발생 제어구덩이를 얕고 짧게 만든다. 빠른 검출이 전부 점선: 사고가 없었을 때의 수율
두 가지 일. 점선이 베이스라인이고 실선이 실제 수율이다. 붉은 넓이가 이상 발생으로 잃은 양이다. 구덩이의 깊이는 사고의 세기가, 폭은 검출과 대응의 속도가 정한다. 깊이는 고를 수 없지만 폭은 샘플링 계획과 경보 규칙으로 줄일 수 있다.

두 일은 쓰는 도구와 시간 단위가 다르다. 베이스라인 개선은 몇 주에서 몇 달에 걸친 일이다. 많은 웨이퍼의 데이터를 모아 파레토를 만들고, 스택 맵과 공통성 분석으로 약한 계통 무늬를 찾고(10장, 13장), 분할 실험으로 개선을 확인한다. 감도가 중요하므로 가장 민감한 검사 조건으로 적은 수의 웨이퍼를 깊이 본다. 이상 발생 제어는 몇 시간에서 며칠의 일이다. 속도가 중요하므로 덜 민감하더라도 빠른 검사로 많은 로트를 자주 본다. 같은 검사 장비라도 두 목적에 쓰는 레시피와 샘플링이 다르다.

공정의 나이에 따라 무게가 옮겨 간다. 개발과 램프 초기에는 베이스라인 손실이 압도적이다. 수율이 30%인 공정에서 한 로트가 사고로 5%p를 더 잃는 것은 큰일이 아니다. 성숙기에는 반대다. 베이스라인은 파레토의 꼬리만 남아 한 해에 1~2%p를 올리기도 어렵고, 수율 변동의 대부분은 이상 발생에서 나온다. 이때는 사고 하나를 며칠 일찍 잡는 것이 몇 달짜리 개선 과제보다 값질 수 있다.

이상 발생을 잡았을 때의 첫 조치는 원인 규명이 아니라 격리(Containment)다. 의심 장비를 세우고, 그 장비를 지나간 웨이퍼를 찾아 보류하고, 아직 되돌릴 수 있는 것(식각 전의 노광은 감광막을 벗기고 다시 할 수 있다)과 없는 것을 가른다. 원인은 그다음에 찾는다(13장). 위험 노출 웨이퍼의 범위를 정하려면 어느 웨이퍼가 언제 어느 챔버를 지났는지의 이력이 있어야 한다. 로트 이력은 범인을 찾는 데도 쓰이지만 피해 범위를 정하는 데 먼저 쓰인다.

검사는 수율을 올리지 않는다검사 장비는 웨이퍼를 고치지 않는다. 검사가 사는 것은 정보이고, 그 정보로 누군가 장비를 세우거나 공정을 고칠 때에만 값이 생긴다. 검사 계획을 평가하는 질문은 "얼마나 많이 보는가"가 아니라 "이 검사 결과로 어떤 결정을 얼마나 빨리 내릴 수 있는가"다. 결정으로 이어지지 않는 검사는 사이클 타임만 늘린다.

사건의 값을 매기다

이 장의 계산을 사건 YB-12에 적용한다. 범인은 11장과 13장에서 이미 잡혔다. 남은 질문은 얼마를 잃었고, 무엇이 있었다면 덜 잃었을까다. 계산에는 사건 기록에 없는 값이 필요하므로 다음을 가정한다. 이 제품은 하루에 한 로트씩 콘택 식각과 M1 노광을 지난다. 그 두 공정에서 웨이퍼 테스트까지는 약 30일이 걸린다. 테스트에서 수율 저하를 본 뒤 원인을 찾아 장비와 레티클을 멈추기까지 약 10일이 걸렸다. 두 문제는 처음부터 같은 세기였다고 단순화한다.

먼저 로트 하나의 손실이다. 홀수 슬롯 13장은 약 88%에서 약 83%로, 짝수 슬롯 12장은 약 73%로 떨어졌다. 반복 결함은 25장 전부에서 약 5%p씩(걸린 다이는 약 6%이지만 그 가운데 일부는 어차피 무작위 결함으로 죽었을 다이다), 도넛은 12장에서 약 10%p씩이다. 1%p가 웨이퍼당 약 12개이므로 반복 결함이 로트당 약 1,500개, 도넛이 약 1,500개, 합쳐 약 3,000개다.

다음은 지나간 로트 수다. 웨이퍼 테스트가 첫 신호였으므로 검사 간격 \(T\)와 무관하게 결과 지연 \(d\)가 30로트였던 셈이다. 여기에 추리에 걸린 10일이 더해져 약 40로트가 두 공정을 지나갔다.

경우첫 신호지나간 로트(약)잃은 다이(약)
실제로 일어난 일웨이퍼 테스트 수율40120,000
콘택 층에 전압 대비 샘플링이 있었다면
로트마다 홀수·짝수 슬롯 1장씩, 결과 하루
도넛: 콘택 식각 다음 날도넛 2 · 반복 4063,000
M1 검사 좌표에 샷 접기 경보가 있었다면
검사는 이미 하고 있었다
반복: M1 식각 다음 날반복 2 · 도넛 4063,000
둘 다 있었다면각 공정 다음 날26,000

12만 개는 평소 수율로 웨이퍼 약 110장에서 나오는 양품 전부에 해당한다. 두 감시가 모두 있었다면 손실은 약 20분의 1이었다. 두 대책의 값은 같지 않다. 샷 접기 경보는 이미 있던 M1 명시야 검사 데이터에 계산 하나를 더하는 일이어서 거의 공짜다. 결함 수가 약 10% 늘어난 것은 총 개수 관리도의 한계 안이었지만(평균 100개라면 1σ), 늘어난 결함은 전부 샷 안의 한 자리에 있었다. 신호는 개수가 아니라 위치에 있었다. 반면 전압 대비 검사는 느려서 로트마다 두 장씩 보려면 전자빔 장비 시간이 꽤 든다. 그래도 4절의 식으로 보면 간격을 다섯 로트로 벌려도 평균 지연은 닷새 안팎이고, 30일보다는 훨씬 짧다. 13장의 시정 조치에 "콘택 층 전압 대비 샘플링 추가"가 들어간 이유다. 표본은 홀수와 짝수 슬롯에서 한 장씩 뽑아야 한다. 홀수 슬롯만 봤다면 챔버 B의 도넛은 끝내 보이지 않았을 것이다.

CASE YB-12사건 파일 · 14장

두 범인이 가져간 것

두 범인이 가져간 것은 로트당 약 3,000개, 발견해서 멈추기까지 약 40로트에 걸쳐 약 12만 개의 다이다(하루 한 로트, 공정에서 테스트까지 30일, 추리 10일을 가정). 손실의 대부분은 범인이 강해서가 아니라 첫 신호가 30일 뒤의 웨이퍼 테스트였기 때문에 생겼다. 반복 결함은 M1 검사 좌표를 샷으로 접어 보기만 했어도, 도넛은 콘택 식각 뒤에 전압 대비 검사를 두 장씩만 했어도 한두 로트 안에 드러났을 것이다.

얻은 단서손실은 약 12만 다이. 그 가운데 약 95%는 검출 지연의 값이다. 반복 결함의 신호는 결함 수가 아니라 위치에 있었고, 도넛의 신호는 광학이 아니라 전압 대비에 있었다.
아직 모르는 것다음 사건은 다른 층, 다른 무늬로 온다. 어느 검사를 어디에 더 둘지는 예산 안에서 다시 정해야 한다.
다음 단계사건 YB-12는 여기서 닫는다. 15장에서는 새 사건을 예산 안에서 직접 푼다. 조사 하나하나에 값이 붙는다.

핵심 정리

  1. 수율 램프의 속도는 학습 사이클 한 번에 줄이는 결함의 비율과 사이클 타임으로 정해진다. 가격은 시간이 갈수록 내려가므로 늦게 오른 수율은 값이 싸다. 인라인 검사와 단축 루프는 웨이퍼 테스트보다 짧은 학습 고리다.
  2. 고칠 순서는 결함 수가 아니라 제한 수율로 정한다. 개수 순위와 손실 순위는 치명률 때문에 다르고, 손실은 곱해지며, 검사에 잡히지 않는 손실은 파레토에 없다. 기준은 들인 자원당 되찾는 수율이다.
  3. 샘플링 계획은 어느 단계 뒤에, 몇 로트마다, 로트당 몇 장을 어느 슬롯에서 뽑을지의 결정이다. 일부 웨이퍼에만 생기는 문제를 볼 확률은 초기하 분포로 구하고, 장비의 챔버 구조를 알고 뽑으면 적은 장수로 충분하다.
  4. 이상 발생의 손실은 위험 노출 웨이퍼 수에 비례한다. 다음 검사까지의 대기, 검사가 놓쳐 되풀이되는 간격, 결과 지연의 합이다. 검사비와 손실의 합이 최소인 간격은 제곱근 법칙을 따르고, 결과 지연은 간격으로 만회되지 않는다.
  5. 관리도는 평소의 흩어짐으로 한계를 긋는다. 3σ 규칙은 오경보가 드물지만 작은 변화에 둔하고, 보조 규칙은 검출을 앞당기는 대신 오경보를 늘린다. 결함 수는 푸아송보다 넓게 흩어지므로 한계를 그대로 쓰면 오경보가 쏟아진다.
  6. 총 개수 관리도는 결함의 종류와 위치를 버린다. 종류별 관리도와 공간 정보를 담은 값(반복 결함 수, 구역별 밀도)을 함께 본다.
  7. 베이스라인 개선은 곡선 전체를 올리는 느린 일이고, 이상 발생 제어는 구덩이의 폭을 줄이는 빠른 일이다. 성숙한 공정일수록 뒤의 것이 수율 변동을 지배한다. 사고를 잡으면 격리가 먼저다.

확인 퀴즈

두 공장이 같은 결함 밀도에서 램프를 시작했다. 공장 가는 8주마다 결함을 30% 줄이고, 공장 나는 4주마다 20% 줄인다. 1년 뒤 결함 밀도가 더 낮은 쪽은? (바닥값은 무시한다)

0.7⁶ ≈ 0.12, 0.8¹³ ≈ 0.055다. 한 번에 배우는 양이 적어도 사이클이 짧으면 더 빨리 내려간다. 사이클 타임을 줄이는 것이 학습 속도를 올리는 가장 확실한 길인 이유다.

결함 파레토에서 개수 1위는 미세 파티클(웨이퍼당 400개, 치명률 4%), 2위는 배선 브리지(150개, 치명률 85%)다. 웨이퍼당 다이는 1,228개다. 어느 것을 먼저 고쳐야 하는가?

제한 수율은 exp(−n·κ/N)이다. 브리지는 exp(−0.104) ≈ 90%, 파티클은 exp(−0.013) ≈ 98.7%다. 개수가 아니라 개수와 치명률의 곱이 손실을 정한다.

챔버가 둘인 식각 장비의 한 챔버에 이상이 생겨 로트 25장 가운데 12장이 영향을 받는다. 검사 장수를 늘리지 않고 검출 확률을 100%로 만드는 방법은?

무작위 2장은 약 74%다. 1번과 3번은 같은 챔버이므로 다른 챔버의 문제는 영원히 못 본다. 챔버가 슬롯 순서대로 번갈아 처리한다는 구조를 알면 두 장으로 두 챔버를 모두 본다. 간격을 줄이는 것은 대기 시간을 줄일 뿐 한 번의 검출 확률은 그대로다.

어느 층의 웨이퍼당 결함 수가 평균 100개에서 110개로 늘었다. 3σ 규칙 하나만 쓰는 결함 수 관리도에서 일어날 일로 알맞은 것은?

σ = √100 = 10, UCL = 130이다. 평균이 110이 되면 한 점이 130을 넘을 확률은 약 2.3%이고 평균 약 44번이 걸린다. 보조 규칙이나 누적형 관리도를 쓰거나, 늘어난 결함의 종류와 위치를 따로 감시해야 한다.