메인 콘텐츠로 건너뛰기
“자동화를 위한 AI가 오늘날의 IT 워크플로우에 어떤 혁신을 가져올 것인가” 블로그 게시물의 이미지
관점

지금쯤이면 여러분(그리고 여러분의 유혹적인 챗봇)이 꼭 알아야 할 12 가지 AI 용어

생성형 AI는 디지털 시대의 가장 위대한 기술적 진보라고 할 수 있다. 하지만 정말로 이해하고 계신가요? 다음은 12가지 주요 GenAI 개념에 대한 안내입니다.

지난 2년 동안 GenAI 가 데이터 과학자 토론 그룹에서부터 주류 언론 보도에 이르기까지 눈부신 성장을 거듭하면서, 한 가지 사실이 명백해졌습니다. 바로 ChatGPT가 지배하는 세상 이라는 점입니다. 우리는 그저 프롬프트를 입력해 줄 뿐입니다.

GenAI 도구의 발전 속도는 정말 놀라울 정도이며, 그 기세가 꺾일 기미가 전혀 보이지 않습니다. 이제 누구나 챗봇에 몇 마디만 입력하면 정교한 연구 보고서, 즉각적인 회의 요약, 바로 인쇄 가능한 디자인 파일, 버그 없는 컴퓨터 코드, 심지어 데이트 앱 프로필과 유혹적인 문자 메시지 등 다양한 내용을 생성할 수 있습니다.

이러한 “훨씬 더 많은 것”은 기업들에게는 수많은 기회를, 공격자들에게는 새로운 공격 경로를, 그리고 이러한 공격을 방어하는 새로운 방법들을 가져다줄 것입니다. 이 기술의 역량과 한계를 완전히 이해하는 것은 이제 경영진과 정보 보안 전문가들에게 있어 필수 요건이 되었습니다.

기억해야 할 핵심은, GenAI 챗봇이 마치 마법처럼 보일지 모르지만, 사실은 그저 매우 정교한 예측 엔진에 불과하다는 점입니다.

ChatGPT, Gemini, Copilot 등과 같은 도구들은 머신러닝 및 대규모 언어 모델(LLM) — 수십억 건의 문서, 이미지, 미디어 파일, 소프트웨어 프로그램으로 훈련된 복잡한 신경망 —에 의존합니다. 언어의 의미와 맥락을 이해함으로써, 대규모 언어 모델(LLM)은 패턴을 인식할 수 있으며, 이를 통해 시퀀스에서 다음에 어떤 단어, 그림, 소리 또는 코드 조각이 나타날 가능성이 높은지 예측할 수 있습니다. 이것이 바로 GenAI 도구가 간단한 자연어 프롬프트 하나만으로도 대부분의 인간보다 더 잘(또는 적어도 더 빠르게) 보고서를 작성하고, 음악을 작곡하고, 단편 영화를 제작하거나, 코드를 작성할 수 있는 방식입니다.

하지만 동료들이 회의에서 LLM이나 GPT 같은 용어를 마구 쏟아낸다고 해서, 그들이(혹은, 에헴, 당신이) 그 용어들을 정말로 이해하고 있다는 뜻은 아닙니다. AGI부터 ZSL까지, 꼭 알아두어야 할 주요 개념들을 담은 비공식 용어집입니다.

1. 인공 일반 지능(AGI)

AI의 궁극적인 형태는 이미 수십 편의 종말 영화에서 주요한 역할을 맡아왔다. AGI는 기계가 독창적인 사고를 할 수 있게 되는 시점으로, 이때 기계는 a) 우리를 최악의 충동으로부터 구해 주거나, b) 하찮은 인간들에게 더 이상 참을 수 없다고 판단하게 될 것입니다. ‘AI의 대부’ 제프리 힌턴(Geoffrey Hinton)과 같은 일부 AI 전문가들은 이에 대해 경고해 왔지만 , 다른 전문가들은 AGI가 과연 가능한지, 더 나아가 언제 실현될지에 대해서는 강력히 반대하고 있다.

기억해야 할 점: AGI가 곧 도래할지 확실히 알기 위해서는 과거로 돌아가 ‘ ’의 사라 코너()에게 물어봐야 할 것입니다.

“AGI는 기계가 독창적인 사고를 할 수 있게 되는 시점으로, 이때 기계는 a) 우리를 최악의 충동으로부터 구해 주거나, b) 하찮은 인간들에게 더 이상 참을 수 없다고 판단하게 될 것입니다.”

2. 데이터 오염

AI 모델 훈련에 사용되는 저장소에 악성 데이터를 주입함으로써, 공격자는 챗봇이 비정상적으로 작동하게 하거나, 오류가 있거나 유해한 답변을 생성하게 하여, 해당 챗봇을 개발한 기업의 운영과 평판을 훼손할 수 있습니다(예를 들어, 의 반자율주행 차량 을 속여 교통 체증 속으로 진입하게 한 사례). 이러한 공격은 훈련 데이터에 대한 직접적인 접근 권한이 필요하기 때문에, 대개 현재 또는 최근까지 근무했던 내부자들에 의해 수행됩니다.. 데이터 접근을 제한하고 성능을 지속적으로 모니터링하는 것이 이러한 공격을 예방하고 탐지하는 핵심입니다.

기억해야 할 점: 여러분의 챗봇이 음모론을 늘어놓는 아가사 이모처럼 말하기 시작하고 있지는 않나요? 해당 데이터가 변조되었을 가능성이 있습니다.

3. 자기조직화 현상

모델의 규모가 커짐에 따라, GenAI 모델은 때때로 개발자가 예상하지 못한 행동을 보이기도 합니다. 예를 들어, 갑자기 벵골어로 대화를 시작하거나, 같은 일이 발생할 수 있습니다. AGI의 경우와 마찬가지로, 이러한 AI 모델들이 진정으로 스스로 새로운 능력을 개발해 냈는지, 아니면 단순히 숨겨져 있던 능력이 드러난 것인지를 둘러싸고 활발한 논의가 이루어지고 있다.

기억해야 할 점: 새로 인수한 회사의 신임 CEO: 채드 GPT.

4. 설명 가능한 인공지능(XAI)

정교한 신경망을 구축하는 사람들조차도 그 작동 원리를 완전히 이해하지는 못합니다. 소위 ‘블랙박스 AI’는 편향되거나 부정확한 훈련 데이터 가 모델의 예측에 영향을 미쳤는지 파악하는 것을 사실상 불가능하게 만드는데, 바로 이 때문에 규제 당국은 모델이 어떻게 결정을 내리는지에 대한 투명성 강화를 점점 더 강력히 요구하고 있다. XAI는 일반적으로 더 적은 층을 사용하는 단순한 신경망을 활용해 데이터를 분석함으로써 이 과정을 더욱 투명하게 만듭니다.

기억해야 할 점: 고객에 대한 의사결정을 내릴 때 AI를 활용하고 있다면, 아마도 이에 대해 설명해야 할 부분이 있을 것입니다.

[함께 읽어보세요: 사이버 보안 전문 용어 중 잘 모르는 것이 있나요? [여러분(그리고 CEO)이 잘 모를 수도 있는 핵심 용어 15 가지를 설명해 드립니다]

5. 기초 모델

기초 LLM은 봇의 두뇌 역할을 합니다. 이 모델들을 훈련시키는 데는 상상할 수 없을 만큼 막대한 양의 데이터와 전력, 그리고 (데이터 서버 냉각을 위한) 물이 필요하기 때문에, 가장 강력한 대규모 언어 모델(LLM)들은 세계 최대 규모의 기술 기업들이 관리하고 있다. 하지만 기업들은 더 작은 규모의, 오픈소스 파운데이션 모델을 활용해 자체적인 사내 봇을 구축할 수도 있습니다.

기억해야 할 점: 챗봇은 집과 같습니다. 제대로 서 있으려면 튼튼한 기초가 필요합니다.

6. 환각

GenAI 챗봇은 영리한 5살짜리 아이와 매우 비슷할 수 있습니다. 질문의 답을 모를 때면 가끔은 지어내기도 하죠. 이처럼 그럴듯하게 들리지만 완전히 허구인 답변들을 ‘환각’이라고 부릅니다. 이는 ‘ ’ 환각과 밀접한 관련이 있는데, 이는 챗봇이 사실이 아닌 내용에 대해 존재하지 않는 출처를 인용하며 주장을 고수할 때 발생하는 현상입니다.

기억해야 할 점: 여러분의 챗봇은 ‘산성 플래시백’을 겪고 있나요? 차 키를 빼앗아 버리는 게 좋을지도 모릅니다. 그리고 RAG(아래 참조)를 사용해 보세요.

“봇과 점점 멀어지는 느낌이 든다면, 그건 아마도 당신 탓이 아니라 데이터 때문일 것입니다.”

7. 모델 드리프트 (일명 AI 드리프트)

드리프트는 모델이 학습에 사용된 데이터가 구식이 되거나 더 이상 현재 상황을 반영하지 못할 때 발생합니다. 이는 외부 상황이 변했음을 의미할 수 있으며(예를 들어, 주택 구매를 예측하도록 설계된 모델의 경우 금리 변동 등), 이로 인해 모델의 예측 정확도가 떨어질 수 있습니다. 오차를 방지하기 위해 기업은 견고한 AI 거버넌스를 구축해야 하며, 모델의 정확도를 지속적으로 모니터링한 뒤 최신 데이터를 바탕으로 미세 조정 및/또는 재훈련을 수행해야 합니다.

기억해야 할 점: 봇과 점점 멀어지는 느낌이 든다면, 그건 아마도 당신 탓이 아니라 데이터 때문일 것입니다.

8. 모델 역전 공격

이는 공격자가 모델을 리버스 엔지니어링하여 정보를 추출할 때 발생합니다. 공격자는 챗봇 질의 결과를 분석함으로써 모델의 작동 방식을 역추적할 수 있으며, 이를 통해 민감한 훈련 데이터를 유출하거나 저렴한 비용으로 모델의 복제본을 생성할 수 있습니다. 데이터를 암호화하고, 학습 후 데이터셋에 노이즈를 도입하면 이러한 공격의 효과를 무력화할 수 있다.

기억해야 할 점: 비싼 LLM의 값싼 모방품들이 인터넷에 속속 등장하기 시작했나요? 리버스 엔지니어링을 거쳤을 수도 있습니다.

[함께 읽어보세요: 생성형 AI가 초래하는 3 가지 주요 위협(그리고 또 다른 위험 1가지)과 이를 막는 방법]

9. 다중 모달 대규모 언어 모델(MLLM)

이 봇들은 텍스트, 음성, 이미지, 오디오 등 다양한 유형의 입력을 받아들여 이에 상응하는 응답을 할 수 있습니다. 이 시스템은 도로 표지판 사진이나 손글씨 메모 등 이미지 속 텍스트를 추출할 수 있으며, 웹 페이지 스크린샷을 바탕으로 간단한 코드를 작성하거나, 오디오를 한 언어에서 다른 언어로 번역하거나, 동영상 속 상황을 설명하거나, 영화 배우처럼 자연스러운( ) 목소리 로 구두로 응답할 수도 있습니다.

기억해 둘 점: 그 봇의 목소리는 매력적으로 들릴지 몰라도, 사실 그녀는 당신에게 별로 관심이 없어요.

10. 프롬프트 주입 공격

정교하게 제작되었지만 악의적인 프롬프트는 챗봇에 내장된 안전 제어 기능을 무력화시켜, 챗봇이 기밀 정보를 유출하거나 “인류를 파괴하기 위한 단계별 계획 ”과 같은 유해한 콘텐츠를 생성하도록 강요할 수 있습니다. 최종 사용자의 권한을 제한하고( ), 사람이 지속적으로 관여하도록 하며(), 대외용 대규모 언어 모델(LLM)과 민감한 정보를 공유하지 않는 것은 이러한 공격으로 인한 피해를 최소화하는 방법입니다.

기억해 두어야 할 점: 챗봇이 좀 너무 말이 많아진 건 아닐까요? 누군가가 악의적인 프롬프트를 삽입했을 수도 있습니다.

“질문에 답변할 때 신뢰할 수 있는 데이터 저장소를 고려하도록 챗봇을 프로그래밍하면 부정확한 답변의 위험을 크게 줄일 수 있습니다.”

11. 검색 기반 생성(RAG)

질문에 답변할 때 신뢰할 수 있는 데이터 저장소를 고려하도록 챗봇을 프로그래밍하면, 부정확한 답변이나 완전히 허구적인 답변이 나올 위험을 크게 줄일 수 있습니다. 또한 RAG를 통해 봇은 기반이 되는 대규모 언어 모델(LLM)이 훈련된 이후에 생성된 데이터에 접근할 수 있어, 응답의 관련성을 높일 수 있습니다.

기억해 두어야 할 점: GenAI 챗봇의 정확도와 신뢰성을 높이고 싶으신가요? 이제 RAG를 할 때가 된 것 같네요.

[함께 읽어보세요: AI가 진정으로 지능적일 수 있도록 하기 위해 고려해야 할 사항]

12. 제로샷 학습(ZSL)

기계 학습 모델은 제로샷 학습을 활용하여 훈련 데이터에서 접해본 적이 없는 객체를 식별할 수 있습니다. 예를 들어, 집고양이를 인식하도록 훈련된 컴퓨터 비전 모델은 공통된 특성과 이러한 동물들이 어떻게 다른지에 대한 이해를 바탕으로 사자나 퓨마를 정확하게 식별할 수 있다. ZSL은 인간의 사고 방식을 모방함으로써 수집 및 라벨링해야 하는 데이터의 양을 줄여 모델 훈련 비용을 절감할 수 있습니다.

기억해야 할 점: 기본적인 용어에 익숙하지 않다면, AI를 이해할 가능성은 전혀 없습니다.