Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
AI 스크래핑의 위험성
스크래핑은 합법인가?
스크래핑한 데이터로 AI를 학습시키는 것은 합법인가?
대규모 스크래핑이 AI에 미치는 영향
AI 생성 데이터가 구원이 될까?
모델 붕괴와 이를 피하는 방법
대기업만이 데이터를 수집할 여유가 있다면 어떻게 될까요?
결론
의견
8월 14, 2024

웹을 쓸어 담으면서 AI는 자신을 오염시키고 있다

웹이 완전히 고갈되고, 콘텐츠 제공자들이 문을 걸어 잠그고, 새로운 데이터를 수집할 수 있는 것이 거의 없을 때 LLM에게는 어떤 의미가 있을까요?
Illustration of a cartoonish robot vacuum cleaner with big eyes and an open mouth, humorously sticking out a tongue to clean,
Alex C-G, Scott Martens • 17 분 소요

최근 AI 기업들이 인터넷상의 모든 데이터를 "허락" 여부와 상관없이 마구잡이로 수집하는 위험성에 대해 많은 논란이 있었습니다. "허락"이라는 단어를 인용부호로 감싼 이유는 나중에 설명하도록 하겠습니다. 하지만 오픈 웹이 모두 채굴되고, 콘텐츠 제공자들이 문을 걸어 잠그고, 새로운 데이터를 수집할 수 있는 통로가 거의 없어진다면 LLM에게는 어떤 의미가 있을까요?

tagAI 스크래핑의 위험성

AI 기업들은 인터넷을 마음대로 먹을 수 있는 데이터 뷔페처럼 대하고 있으며, 테이블 매너도 무시하고 있습니다. Runway가 YouTube의 이용약관을 위반하며 모델 학습을 위해 동영상을 수집하는 것, Anthropic이 iFixit 사이트를 하루에 백만 번씩 접속하는 것, 그리고 New York Times가 저작권이 있는 콘텐츠 사용에 대해 OpenAI와 Microsoft를 고소한 것을 보십시오.

robots.txt나 이용약관으로 스크래퍼를 차단하려는 시도는 전혀 도움이 되지 않습니다. 규칙을 무시하는 스크래퍼들은 어차피 계속 수집할 것이고, 규칙을 준수하는 스크래퍼들만 차단될 것입니다. 스크래퍼들이 규칙을 준수할 동기가 전혀 없습니다. 이는 Data Provenance Initiative의 최근 논문에서도 확인할 수 있습니다:

Data Provenance Initiative
Auditing the data used to train AI models

이는 단순한 추상적 문제가 아닙니다 - iFixit는 금전적 손실을 보고 DevOps 리소스가 묶여버립니다. ReadTheDocs는 악의적인 크롤러로 인해 한 달 동안 5,000달러 이상의 대역폭 요금이 발생했고, 하루에만 거의 10 TB의 트래픽이 발생했습니다. 만약 여러분이 웹사이트를 운영하고 있는데 규칙을 따르지 않는 크롤러의 공격을 받는다면? 그것은 서비스 중단으로 이어질 수 있습니다.

그렇다면 웹사이트는 어떻게 해야 할까요? AI 기업들이 규칙을 준수하지 않는다면, 유료화가 증가하고 무료로 이용 가능한 콘텐츠는 감소할 것입니다. 자유로운 웹은 더 이상 존재하지 않습니다. 남은 것은 유료 서비스뿐입니다.

tag스크래핑은 합법인가?

💡
우리는 법률 전문가가 아니며 법률 자문을 제공할 수 없습니다. 다음은 정보 제공 목적의 기존 법률에 대한 개요입니다.

스크래핑은 문제가 될까요? 네. 합법일까요? 역시 네. 웹 스크래핑은 미국, 유럽연합, 일본, 한국, 캐나다에서 합법입니다. 이 관행을 구체적으로 다루는 법률을 가진 국가는 없는 것 같지만, 전 세계 법원들은 일반적으로 누구나 볼 수 있는 웹사이트를 자동화된 방식으로 방문하고 그 콘텐츠의 개인적인 복사본을 만드는 것이 합법이라는 데 동의합니다.

웹 페이지나 robots.txt 파일에 고지사항을 게시함으로써 웹사이트와 그 콘텐츠의 합법적 사용이나 스크래핑을 금지할 수 있다고 믿는 사람들이 있습니다. 하지만 이는 실제로 작동하지 않습니다. 그러한 고지사항은 법적 의미가 없으며, robots.txt는 법적 구속력이 없는 IETF 규약입니다. 최소한 "이용약관에 동의합니다" 버튼을 클릭하는 등의 확인 행위 없이는 웹사이트 방문자에게 조건을 부과할 수 없으며, 그러한 조건도 법적으로 강제할 수 없는 경우가 많습니다.

Your Website Terms of Service are Unenforceable | Insights | Venable LLP
Venable LLPJoshua J. Kaufman

하지만 스크래핑이 합법이더라도 몇 가지 제한사항이 있습니다:

  • 웹 스크래퍼로 너무 자주 또는 너무 빠르게 접속하여 다른 사용자의 웹사이트 이용을 방해할 수 있는 행위는 극단적인 경우 민사상 또는 형사상 처벌을 받을 수 있습니다.
  • 많은 국가에서 무단으로 컴퓨터에 접근하는 것을 범죄로 규정하고 있습니다. 일반 대중이 접근하도록 의도되지 않은 웹사이트 부분을 스크래핑하는 것은 불법일 수 있습니다.
  • 많은 국가에서 복제 방지 기술을 우회하는 것을 불법으로 규정하고 있습니다. 웹사이트가 일부 콘텐츠의 다운로드를 방지하기 위한 조치를 취했다면, 그것을 스크래핑하는 것은 법률 위반이 될 수 있습니다.
  • 명시적인 이용약관이 있고 이에 대한 동의를 요구하는 웹사이트는 스크래핑을 금지하고 이를 위반할 경우 법적 조치를 취할 수 있지만, 결과는 불확실합니다.

미국에는 스크래핑에 대한 명시적인 법률이 없지만, 1986년 Computer Fraud and Abuse Act를 사용하여 이를 금지하려는 시도는 실패했으며, 가장 최근에는 2019년 제9순회법원의 hiQ Labs v. LinkedIn 사건에서도 실패했습니다. 미국 법은 복잡하며, 법원이 만든 많은 구별과 주 및 연방 순회 관할권 시스템으로 인해 대법원이 판결하지 않는 한 최종적이지 않을 수 있습니다. (때로는 그렇게 해도 최종적이지 않을 수 있습니다.)

EU도 스크래핑을 다루는 특정 법률은 없지만, 이는 오랫동안 일반적이고 이의 없이 행해져 온 관행입니다. 2019년 EU 저작권 지침의 텍스트 및 데이터 마이닝 조항은 스크래핑이 일반적으로 합법이라는 것을 강하게 시사합니다.

가장 큰 법적 문제는 스크래핑 행위 자체가 아니라 스크래핑 후에 일어나는 일과 관련이 있습니다. 웹에서 스크래핑한 데이터에도 저작권이 적용됩니다. 개인적인 복사본은 보관할 수 있지만, 법적 문제의 소지가 있는 재배포나 재판매는 할 수 없습니다.

대규모 웹 스크래핑은 거의 항상 다양한 데이터 보호 및 개인정보 보호법에서 정의하는 "개인정보"의 복사본을 만드는 것을 의미합니다. 유럽의 GDPR (일반 데이터 보호 규정)은 "개인정보"를 다음과 같이 정의합니다:

식별되었거나 식별 가능한 자연인('정보주체')과 관련된 모든 정보; 식별 가능한 자연인은 특히 이름, 식별 번호, 위치 데이터, 온라인 식별자와 같은 식별자나 해당 자연인의 신체적, 생리학적, 유전적, 정신적, 경제적, 문화적 또는 사회적 정체성에 특정된 하나 이상의 요소를 참조하여 직접 또는 간접적으로 식별될 수 있는 사람을 의미합니다.

[GDPR, Art. 4.1]

EU에 거주하는 사람이나 EU에서 발생하는 활동과 관련된 개인정보를 보유하고 있다면, GDPR에 따른 법적 책임이 있습니다. 그 범위가 너무 광범위해서 대규모 데이터 수집에는 모두 적용된다고 가정해야 합니다. 데이터를 수집한 것이 귀하인지 다른 사람인지는 중요하지 않으며, 현재 데이터를 보유하고 있다면 그에 대한 책임이 있습니다. GDPR 의무를 이행하지 않으면, 데이터가 저장되거나 처리되는 국가와 관계없이 EU가 처벌할 수 있습니다.

캐나다의 PIPEDA (개인정보 보호 및 전자문서법)는 GDPR과 유사합니다. 일본의 APPI (개인정보보호법)도 비슷한 내용을 다룹니다. 영국은 EU를 탈퇴하면서 GDPR의 대부분을 국내법에 통합했으며, 나중에 수정되지 않는 한 여전히 효력이 있습니다.

미국은 연방 차원에서 이와 비슷한 데이터 보호법이 없지만, CCPA (캘리포니아 소비자 개인정보 보호법)는 GDPR과 유사한 조항을 가지고 있으며 캘리포니아 주의 사람이나 활동에 대한 데이터를 보유하고 있는 경우 적용됩니다.

대부분의 선진국들은 웹에서 수집한 대규모 데이터를 사용하는 것을 적어도 일부 측면에서 제한하는 데이터 보호법을 가지고 있습니다. 전 세계적으로 스크래핑과 관련된 대부분의 법적 절차는 데이터 수집 방법이 아닌 데이터 사용 방법에 관한 것이었습니다.

따라서 웹 스크래핑은 거의 항상 합법입니다. 그 이후에 일어나는 일이 복잡해지는 것입니다.

tag스크래핑한 데이터로 AI를 학습시키는 것은 합법인가?

아마도 그럴 것입니다.

현실적으로 웹 스크래핑은 거의 모든 경우에 저작권이 있는 콘텐츠를 포함하게 됩니다. 진짜 문제는 다음과 같습니다: 소유자의 허락 없이 저작권이 있는 콘텐츠로 AI를 학습시킬 수 있을까요?

완전히 해결되지 않은 많은 개별적인 법적 쟁점들이 있지만:

  • 유럽에서는 2019년 EU 저작권 지침 제4조가 일부 제한 사항과 함께 합법화한 것으로 보입니다.
  • 일본에서는 2018년 개정된 저작권법 제30조 제4항이 허가 없이 저작권이 있는 작품을 AI 학습에 사용할 수 있는 것으로 해석되었습니다.
  • 미국에서는 이 상황을 특별히 다루는 법률은 없지만, 저작권이 있는 자료의 통계적 분석은 상업적 제품이 결과물이더라도 수년간 당연히 합법적인 것으로 여겨져 왔습니다. Authors Guild, Inc. v. Google, Inc.와 Authors Guild, Inc. v. HathiTrust 소송이 AI를 특별히 다루지는 않지만, 미국 법에서 "공정 사용"의 범위를 너무 광범위하게 확장하여 AI 학습이 불법일 수 있다고 보기는 어렵습니다. 미국 법체계는 명시적인 답변을 제공하지 않으며, 이 결론을 시험하는 여러 사례들이 현재 법원에서 진행 중입니다.

다수의 작은 관할권에서도 이것이 합법이라고 결정했으며, 제가 아는 한 지금까지 불법이라고 판단한 곳은 없습니다.

유럽 저작권법은 저작권 소유자가 "적절한 방식으로" 표시함으로써 자신의 작품이 AI 학습에 사용되는 것을 제한할 수 있도록 합니다. 현재로서는 이를 어떻게 해야 하는지에 대한 지침이 없습니다.

일본 저작권법은 "저작권자의 이익을 부당하게 해칠 수 있는" 경우 저작권 자료의 사용을 제한합니다. 이는 일반적으로 저작권자가 특정 AI 모델이 자신의 작품의 경제적 가치를 감소시킨다는 것을 입증해야 소송을 제기할 수 있음을 의미합니다.

Google, Microsoft, OpenAI, Adobe, 그리고 Shutterstock이 자사의 생성형 AI 제품 사용자가 저작권 관련 법적 문제에 직면할 경우 보상을 제공하기로 했다는 점에 주목해야 합니다. 이는 그들의 법률가들이 미국 법 아래에서 자신들의 행위가 합법이라고 판단하고 있다는 강력한 신호입니다.

tag대규모 스크래핑이 AI에 미치는 영향

AI 스크래핑 열풍이 웹을 디지털 와일드 웨스트로 만들고 있습니다. 이러한 스크래퍼들은 robots.txt를 무시한 채 iFixit 같은 웹사이트에 끊임없는 요청을 보내고 있습니다. 이는 단순히 성가신 것을 넘어서 개방된 인터넷의 작동 방식을 재고하게 만드는 잠재적으로 웹을 파괴할 수 있는 문제입니다. 혹은 가까운 미래에 작동하지 않을 수도 있습니다. 경제적, 사회적 관점에서만 봐도 많은 것이 변할 수 있습니다:

신뢰 붕괴: 이 AI 급증 현상은 웹 전반에 걸쳐 대규모 신뢰 붕괴를 초래할 수 있습니다. 모든 웹사이트가 의심의 눈초리로 당신을 맞이하고, 콘텐츠를 보기 전에 인간임을 증명하도록 요구하는 미래를 상상해보세요. 더 많은 CAPTCHA, 더 많은 로그인 장벽, 더 많은 "모든 교통신호를 클릭하세요" 테스트가 있을 것입니다. 마치 스피크이지에 들어가는 것 같지만, 비밀 암호 대신 당신이 매우 영리한 기계가 아니라는 것을 도어맨에게 납득시켜야 합니다.

제한된 인간 생성 콘텐츠: 자신의 작업이 도용되는 것을 우려하는 콘텐츠 제작자들이 방어벽을 치기 시작하고 있습니다. 유료화, 구독자 전용 섹션, 콘텐츠 잠금이 급증할 수 있습니다. 자유롭게 브라우징하고 배우던 시대는 다이얼업 모뎀 소리나 AIM 부재중 메시지처럼 향수 어린 기억이 될 수 있습니다. 일반 사람들이 접근할 수 없다면, 불법 스크래퍼가 접근하는 것도 더욱 어려워질 것입니다.

법적 소송: AI를 둘러싼 모든 법적 문제가 해결되기까지는 수년 또는 수십 년이 걸릴 수 있습니다. 우리는 인터넷을 약 30년 동안 사용해 왔지만, 그 법적 문제 중 일부는 오늘날까지도 해결되지 않았습니다. 당신이 옳든 그르든, 무엇이 허용되고 허용되지 않는지 알아내기 위해 수년간의 법정 다툼을 감당할 여유가 없다면, 걱정할 것이 있습니다.

작은 업체는 파산하고, 큰 업체는 더 커진다: 이 스크래핑 열풍은 단순한 성가심을 넘어 웹 인프라에 실제 부담을 주고 있습니다. AI로 인한 트래픽 정체를 겪는 사이트들은 더 강력한 서버로 업그레이드해야 할 수 있는데, 이는 저렴하지 않습니다. 작은 사이트들과 멋진 개인 프로젝트들은 경쟁에서 밀려날 수 있어, AI 기업들과 라이선스 계약을 맺을 수 있거나 폭풍을 견딜 만큼 큰 업체들만이 지배하는 웹(과 LLM 훈련 데이터)이 남을 수 있습니다. 이는 인터넷(과 LLM 지식)을 덜 다양하고 덜 흥미롭게 만들 수 있는 "부자만의 생존" 시나리오입니다. 자유롭게 이용 가능한 데이터에 대한 문을 닫음으로써, 그들은 AI 기업들에게 입장료를 부과하거나 단순히 최고 입찰자에게 라이선스를 줄 수 있습니다. 돈이 없나요? 경비원이 당신을 문 밖으로 안내할 것입니다.

tagAI 생성 데이터가 구원이 될까?

데이터 수집은 웹사이트들을 흔들어놓을 뿐만 아니라, 잠재적인 AI 지식 가뭄의 단계를 만들고 있습니다. 개방된 웹이 성을 올리면서, AI 모델들은 새롭고 고품질의 데이터를 갈망하게 될 것입니다.

이러한 데이터 부족은 AI의 시야를 좁히는 나쁜 결과를 초래할 수 있습니다. 새로운 정보의 지속적인 유입이 없다면, AI 모델들은 구식 지식의 메아리방이 될 위험이 있습니다. AI에게 시사 문제에 대해 물어보았는데 작년의 답변을 듣거나, 더 나쁘게는 사실이 휴가를 간 평행 우주의 답변을 듣는 것을 상상해보세요.

인간이 생성한 데이터가 잠겨있다면, 기업들은 여전히 어딘가에서 훈련 데이터를 얻어야 합니다. 이에 대한 한 예시가 합성 데이터입니다: 다른 LLM을 훈련시키기 위해 LLM이 만든 데이터입니다. 여기에는 모델 증류와 편향을 보완하기 위한 훈련 데이터 생성과 같은 널리 사용되는 기술이 포함됩니다.

When AI Makes AI: Synthetic Data, Model Distillation, And Model Collapse
AI creating AI! Is it the end of the world? Or just another tool to make models do value-adding work? Let's find out!

합성 데이터를 사용하면 점점 더 어려워지고 있는 인간이 생성한 데이터의 라이선스를 얻기 위해 복잡한 과정을 거칠 필요가 없습니다. 또한 균형을 맞추는 데도 도움이 됩니다 - 인터넷의 많은 데이터가 실제 세계의 다양성을 대표하지 못합니다. 합성 데이터를 생성하면 모델이 현실을 더 잘 대표하도록 만드는 데 도움이 될 수 있습니다(때로는 그렇지 않을 수도 있습니다). 마지막으로, 의료 및 법률 사용 사례에서는 합성 데이터를 통해 개인 식별 정보를 제거하기 위해 데이터를 정화할 필요가 없어집니다.

하지만 반대로, 미래의 모델들은 훈련에 사용하고 싶지 않은 AI 생성 데이터로도 훈련될 것입니다. 바로 "슬롭"이라 불리는 저품질 AI 생성 데이터입니다. 예를 들어 한때 사랑받던 테크 블로그가 이전 직원들의 이름으로 저품질 AI 생성 기사를 게시하는 경우, 크록팟 모히토와 브라트부르스트 아이스크림 같은 있을 법하지 않은 요리의 AI 생성 레시피, 또는 페이스북을 점령한 새우 예수와 같은 것들입니다.

이는 전통적인 수작업 콘텐츠보다 훨씬 저렴하고 쉽게 만들 수 있기 때문에, 급속도로 인터넷을 범람시키고 있습니다.

오늘날 우리가 보고 있는 것을 바탕으로 하면, AI 생성 콘텐츠가 사용 가능한 인간 생성 콘텐츠를 능가하고 있습니다. GPT-5는 (부분적으로) GPT-4가 만든 데이터로 훈련될 것입니다. 그리고 GPT-6는 차례로 GPT-5가 만든 데이터로 훈련될 것입니다. 이런 식으로 계속됩니다.

tag모델 붕괴와 이를 피하는 방법

자신의 출력을 입력으로 사용하는 것은 인간과 LLM 모두에게 좋지 않습니다. 합성 데이터를 얼마나 사용할지, 어떤 종류를 사용할지 매우 신중하게 선택하더라도, 모델이 악화되지 않을 것이라고 보장할 수 없습니다.

생성형 AI 모델 전반에 걸쳐, 출력의 품질과 다양성 저하는 실험적으로 측정 가능하며 상당히 빠르게 발생합니다. 이미지 생성 모델은 몇 세대 후에 이상 현상을 보이며, 한 논문에서는 프롬프트에 대해 일관되고 정확한 응답을 했던 위키피디아 데이터로 훈련된 대규모 언어 모델이, 자신의 출력으로 훈련한 9세대 후에는 프롬프트에 대해 "tailed jackrabbits"라는 단어를 반복해서 응답하게 되었습니다.

재귀적으로 생성된 데이터로 학습된 AI 모델의 붕괴 - Nature
 분석에 따르면 인터넷에서 데이터를 수집하여 실제 콘텐츠와 생성된 콘텐츠를 무차별적으로 학습하는 생성형 인공지능은 다양하고 높은 품질의 출력을 생성하는 능력이 붕괴될 수 있습니다.
NatureIlia Shumailov

이는 쉽게 설명할 수 있습니다: AI 모델은 학습 데이터의 근사치입니다. AI 모델 출력으로 학습된 AI 모델은 근사치의 근사치입니다. 각 학습 주기마다 근사치와 "실제" 현실 세계 데이터 간의 차이가 점점 더 커집니다.

우리는 이를 "모델 붕괴"라고 부릅니다.

AI 생성 데이터가 점점 더 널리 퍼짐에 따라, 인터넷에서 수집한 데이터로 새로운 모델을 학습하면 모델 성능이 저하될 위험이 있습니다. 우리는 다음과 같이 생각할 만한 이유가 있습니다 - 실제 인간이 만든 데이터의 양이 감소하지 않는 한 우리의 모델이 크게 나빠지지는 않겠지만, 더 나아지지도 않을 것입니다. 하지만 AI가 만든 데이터와 인간이 만든 데이터를 구분할 수 없다면 학습에 더 오랜 시간이 걸릴 것입니다. 새로운 모델은 성능 향상 없이 제작 비용만 더 비싸질 것입니다.

Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data
The proliferation of generative models, combined with pretraining on web-scale data, raises a timely question: what happens when these models are trained on their own generated outputs? Recent investigations into model-data feedback loops proposed that such loops would lead to a phenomenon termed model collapse, under which performance progressively degrades with each model-data feedback iteration until fitted models become useless. However, those studies largely assumed that new data replace old data over time, where an arguably more realistic assumption is that data accumulate over time. In this paper, we ask: what effect does accumulating data have on model collapse? We empirically study this question by pretraining sequences of language models on text corpora. We confirm that replacing the original real data by each generation's synthetic data does indeed tend towards model collapse, then demonstrate that accumulating the successive generations of synthetic data alongside the original real data avoids model collapse; these results hold across a range of model sizes, architectures, and hyperparameters. We obtain similar results for deep generative models on other types of real data: diffusion models for molecule conformation generation and variational autoencoders for image generation. To understand why accumulating data can avoid model collapse, we use an analytically tractable framework introduced by prior work in which a sequence of linear models are fit to the previous models' outputs. Previous work used this framework to show that if data are replaced, the test error increases with the number of model-fitting iterations; we extend this argument to prove that if data instead accumulate, the test error has a finite upper bound independent of the number of iterations, meaning model collapse no longer occurs.
arXiv.orgMatthias Gerstgrasser

여기에는 짙은 아이러니가 있습니다. AI의 왕성한 데이터 욕구가 데이터 기근으로 이어질 수 있다는 것입니다. Model Autophagy Disorder는 AI에게 있어 광우병과 같습니다: 소의 사체를 소에게 먹이는 것이 새로운 종류의 기생충성 뇌질환을 일으켰듯이, 늘어나는 AI 출력으로 AI를 학습시키는 것은 치명적인 정신 병리를 초래합니다.

Self-Consuming Generative Models Go MAD
Seismic advances in generative AI algorithms for imagery, text, and other data types has led to the temptation to use synthetic data to train next-generation models. Repeating this process creates an autophagous (self-consuming) loop whose properties are poorly understood. We conduct a thorough analytical and empirical analysis using state-of-the-art generative image models of three families of autophagous loops that differ in how fixed or fresh real training data is available through the generations of training and in whether the samples from previous generation models have been biased to trade off data quality versus diversity. Our primary conclusion across all scenarios is that without enough fresh real data in each generation of an autophagous loop, future generative models are doomed to have their quality (precision) or diversity (recall) progressively decrease. We term this condition Model Autophagy Disorder (MAD), making analogy to mad cow disease.
arXiv.orgSina Alemohammad

좋은 소식은 AI가 우리의 데이터가 필요하기 때문에 인류를 대체할 여유가 없다는 것입니다. 나쁜 소식은 데이터 소스를 망가뜨림으로써 스스로의 성장을 저해할 수 있다는 것입니다.

이러한 예견된 AI 지식 기근을 피하기 위해서는 AI 모델을 학습하고 사용하는 방식을 재고해야 합니다. 우리는 이미 Retrieval-Augmented Generation과 같은 해결책을 보고 있는데, 이는 AI 모델을 사실적 정보의 출처로 사용하는 것을 피하고 대신 외부 정보 소스를 평가하고 재구성하는 장치로 보는 것입니다. 또 다른 방법은 특정 작업 클래스를 수행하도록 모델을 조정하고 좁은 도메인에 초점을 맞춘 큐레이트된 학습 데이터를 사용하는 전문화입니다. ChatGPT와 같은 범용 모델을 LawLLM, MedLLM, MyLittlePonyLLM 등과 같은 전문가 AI로 대체할 수 있습니다.

다른 가능성들도 있으며, 연구자들이 어떤 새로운 기술을 발견할지 말하기는 어렵습니다. 아마도 더 나은 합성 데이터를 생성하는 방법이나 더 적은 데이터로 더 나은 모델을 얻는 방법이 있을 수 있습니다. 하지만 더 많은 연구가 문제를 해결할 것이라는 보장은 없습니다.

결국, 이 도전은 AI 커뮤니티가 창의력을 발휘하도록 강요할 수 있습니다. 결국 필요는 발명의 어머니이며, 데이터가 부족한 AI 환경은 진정으로 혁신적인 해결책을 촉발할 수 있습니다. 누가 알겠습니까? AI의 다음 큰 돌파구는 더 많은 데이터가 아닌, 더 적은 것으로 더 많은 것을 하는 방법을 찾아내는 것에서 올 수 있습니다.

tag대기업만이 데이터를 수집할 여유가 있다면 어떻게 될까요?

오늘날 많은 사람들에게 인터넷은 손에 쥐고 있는 검은 유리 직사각형을 통해 보는 Facebook, Instagram, X입니다. 이는 동질화되고, "안전"하며, 게이트키퍼들이 (정책과 알고리즘을 통해) 당신이 무엇을(그리고 누구를) 보고 보지 않을지 결정합니다.

항상 이렇지는 않았습니다. 불과 몇십 년 전만 해도 사용자 생성 블로그, 독립적인 웹사이트 등이 훨씬 더 많았습니다. 80년대에는 수십 개의 운영 체제와 하드웨어 표준이 경쟁하고 있었습니다. 하지만 2010년대에는 Apple과 Microsoft가 승리를 거두며 동질화 추세를 시작했습니다.

웹 브라우저, 스마트폰, 소셜 미디어 사이트에서도 같은 현상을 볼 수 있습니다. 우리는 다양성과 새로운 아이디어의 폭발로 시작하여 큰 플레이어들이 공을 독차지하고 다른 사람들이 경쟁하기 어렵게 만듭니다.

그렇다고 해도, 그러한 플레이어들이 독점권을 가지고 있었음에도 불구하고 일부 작은 업체들이 몰래 들어왔습니다. (Linux와 Firefox를 예로 들 수 있습니다). LLM에서는 "약자의 성공"이 일어날 가능성이 낮습니다. 작은 플레이어들이 다양하고 최신의 학습 데이터에 접근할 재정적 여력이 없을 때, 그들은 고품질 모델을 만들 수 없습니다. 그리고 그것 없이는 어떻게 사업을 유지할 수 있을까요?

거대 기업들은 더 넓은 웹이 허리띠를 조이는 동안에도 AI 모델에 신선한 정보를 꾸준히 공급할 자원을 가지고 있습니다. 반면 작은 플레이어들과 스타트업들은 데이터 통의 바닥을 긁으며 알고리즘에 오래된 부스러기로 영양을 공급하기 위해 고군분투하고 있습니다. 이는 눈덩이처럼 불어날 수 있는 지식 격차입니다. 데이터가 풍부한 기업들이 통찰력과 능력에서 더 부유해짐에 따라, 데이터가 부족한 기업들은 날이 갈수록 AI가 더 구식이 되고 경쟁력이 떨어지면서 더 뒤처질 위험이 있습니다. 이는 단순히 누가 가장 화려한 AI 장난감을 가지고 있느냐의 문제가 아닙니다 - 이는 누가 기술, 상업, 심지어 우리가 정보에 접근하는 방식의 미래를 형성할 것인가에 관한 것입니다. 우리는 소수의 기술 거대 기업들이 가장 발전된 AI 왕국의 열쇠를 쥐고 있는 동안, 다른 모든 이들은 디지털 암흑기에서 들여다보는 미래를 바라보고 있습니다.

라이선스를 받을 수 있는 매력적인 콘텐츠가 많이 떠돌고 있지만, 옛날 Netflix처럼 한 대기업이 모든 것의 라이선스를 가질 가능성은 낮습니다. 기억하시나요? 하나의 서비스에 가입하면 꿈꾸던 모든 쇼를 볼 수 있었습니다. 오늘날 쇼들은 Hulu, Netflix, Disney+, 그리고 이번 주에 HBO Max를 뭐라고 부르든 간에 여러 서비스에 분산되어 있습니다. 때로는 당신이 좋아하는 쇼가 그저 공중으로 사라질 수 있습니다. 이것이 LLM의 미래가 될 수 있습니다: Google은 Reddit에 우선 접근권을 가지고, OpenAI는 Financial Times에 접근권을 얻습니다. iFixit? 그 데이터는 더 이상 존재하지 않고, 단지 먼지 쌓인 임베딩으로만 저장되어 있으며, 절대 업데이트되지 않습니다. 하나의 모델이 모든 것을 지배하는 대신, 우리는 AI 벤더들 사이에서 라이선스 권리가 뒤섞이면서 파편화와 변화하는 능력을 마주할 수 있습니다.

tag결론

좋든 싫든 스크래핑은 계속될 것입니다. 이미 콘텐츠 제공업체들은 접근을 제한하는 장벽을 세우고 있으며, 콘텐츠 라이선스를 감당할 수 있는 이들에게만 문을 열어주고 있습니다. 이는 LLM이 학습할 수 있는 리소스를 심각하게 제한하는 한편, 작은 기업들은 수익성 있는 콘텐츠를 위한 입찰 경쟁에서 밀려나고 있으며, 남은 전리품은 거대 기술 기업들의 LLM들 사이에서 나눠지고 있습니다. 이는 마치 넷플릭스 이후의 스트리밍 세계와 같지만, 이번에는 지식을 대상으로 하고 있습니다.

인간이 생성한 데이터는 줄어드는 반면, AI가 생성한 "질 낮은 콘텐츠"는 급증하고 있습니다. 이러한 데이터로 모델을 학습시키면 성능 향상이 둔화되거나 심지어 모델이 붕괴될 수 있습니다. 이를 해결하는 유일한 방법은 고정관념을 벗어나 생각하는 것입니다. 혁신과 파괴적 혁신의 문화를 가진 스타트업들이 이에 가장 적합합니다. 하지만 대기업들에게만 라이선스가 부여되는 바로 그 데이터가 이러한 스타트업들이 생존하는 데 필요한 핵심 자원입니다.

데이터에 대한 공정한 접근을 제한함으로써, 거대 기업들은 단순히 경쟁을 억제하는 것이 아니라 AI 자체의 미래를 질식시키고 있으며, 이 잠재적인 디지털 암흑기를 넘어설 수 있는 혁신 자체를 질식시키고 있습니다.

AI 혁명은 미래가 아닌 현재입니다. 윌리엄 깁슨의 말을 빌리자면: "미래는 이미 와 있다. 단지 고르지 않게 분배되어 있을 뿐이다." 이는 더욱 불균등하게 분배될 수 있습니다.

범주:
의견
rss_feed

자세히 보기
8월 14, 2024 • 17 분 소요
By Hoovering Up the Web, AI Is Poisoning Itself
Alex C-G
Scott Martens
Illustration of a cartoonish robot vacuum cleaner with big eyes and an open mouth, humorously sticking out a tongue to clean,
5월 24, 2024 • 4 분 소요
RAG is Dead, Again?
Han Xiao
Cartoon of four characters in a cemetery with graves marked "RAG," mixing somber themes with humorous actions.
5월 07, 2024 • 12 분 소요
When AI Makes AI: Synthetic Data, Model Distillation, And Model Collapse
Scott Martens
Abstract depiction of a brain in purple and pink hues with a fluid, futuristic design against a blue and purple background.
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.