Skip to content

Latest commit

 

History

History
70 lines (46 loc) · 6.02 KB

File metadata and controls

70 lines (46 loc) · 6.02 KB

학술 초록 도메인 — Raw vs Humanized

한국어 논문 abstract / introduction 의 humanizer 적용. 사실·인용·수치 strict 보존, "사료된다 / 시사한다" 같은 학술 격식 일부 의도적으로 살림.


메타데이터

항목
도메인 학술 초록 (논문 abstract, 글말체, 격식)
강한 카테고리 #3 번역체·과격식, #6 수동태, #4 것이다·이러한·해당
톤 디폴트 ~다체 글말체 (학술 격식)
톤 보존 "사료된다 / 시사한다 / 다음과 같다" 일부 살림 — 학술 톤이 의도된 것
금지 변경 수치·고유명사·논문명·인용문·통계치

사례. AI 생성 한국어 텍스트 탐지 연구 (가상)

프롬프트

한국어 AI 텍스트 탐지 휴리스틱을 다룬 논문 abstract 를 8-10 문장으로 써줘.

Raw

본 연구는 한국어 텍스트에서 AI 생성 여부를 탐지하는 새로운 휴리스틱 방법론을 제안한다. 기존 연구들은 주로 영어 기반 모델에 초점을 맞추어 왔으며, 한국어의 형태론적 특성을 충분히 반영하지 못하는 한계가 있었다. 이러한 한계를 극복하기 위해, 본 논문에서는 종결어미 분포, 띄어쓰기 변이, 그리고 어휘 빈도 패턴을 결합한 다층 탐지 프레임워크를 제시한다. 제안된 프레임워크는 KatFish 벤치마크와 자체 수집한 한국어 코퍼스 (총 47,200 샘플) 를 활용하여 평가되었다. 실험 결과, 제안 방법은 기존 베이스라인 대비 평균 12.4% 향상된 F1 점수를 기록하였으며, 특히 짧은 텍스트 환경에서 의미 있는 성능 개선을 보였다. 또한 도메인 일반화 측면에서도 학술·뉴스·SNS 세 장르에서 일관되게 우수한 결과를 보고하였다. 본 연구의 기여는 다음과 같이 요약될 수 있다. 첫째, 한국어 특화 형태론적 신호를 탐지에 적극적으로 활용하였다. 둘째, 다양한 도메인에서의 일반화 가능성을 실험적으로 입증하였다. 향후 연구로는 발화체 도메인에 대한 확장 적용 및 모델 귀속 (model attribution) 과제로의 응용을 계획하고 있다.

10문장 / 약 510자

Humanized

본 연구는 한국어 텍스트에서 AI 생성 여부를 탐지하는 새 휴리스틱 방법론을 제안한다. 기존 연구는 영어 기반 모델에 초점을 맞춰 왔고, 한국어의 형태론적 특성을 충분히 반영하지 못하는 한계가 있었다. 이 한계를 풀기 위해, 본 논문에서는 종결어미 분포, 띄어쓰기 변이, 어휘 빈도 패턴을 결합한 다층 탐지 프레임워크를 제시한다. 제안된 프레임워크는 KatFish 벤치마크와 자체 수집한 한국어 코퍼스 (총 47,200 샘플) 로 평가하였다. 실험 결과, 제안 방법은 기존 베이스라인 대비 평균 12.4% 향상된 F1 점수를 기록하였고, 특히 짧은 텍스트 환경에서 의미 있는 성능 개선을 보였다. 도메인 일반화 측면에서도 학술·뉴스·SNS 세 장르에서 일관되게 우수한 결과를 보고하였다. 본 연구의 기여는 다음과 같이 요약된다. 첫째, 한국어 특화 형태론적 신호를 탐지에 적극 활용하였다. 둘째, 여러 도메인에서의 일반화 가능성을 실험적으로 입증하였다. 향후 연구로는 발화체 도메인에 대한 확장 적용 및 모델 귀속 (model attribution) 과제로의 응용을 계획하고 있다.

10문장 / 약 470자 (-7.8%)

변경 (5 곳)

# 카테고리 Before → After
1 #4 이러한 + #7 연결어 "이러한 한계를 극복하기 위해" → "이 한계를 풀기 위해"
2 #3 번역체 "활용하여 평가되었다" → "로 평가하였다" (수동→능동)
3 #7 또한 "또한 도메인 일반화 측면에서도" → "도메인 일반화 측면에서도"
4 #6 수동태 + #11 hedging "다음과 같이 요약될 수 있다" → "다음과 같이 요약된다"
5 #2 공허한 형용사 "다양한 도메인에서의" → "여러 도메인에서의"

보존

  • 수치: 47,200 / 12.4% / "8-10 문장" / 모든 정량 지표 글자 단위 동일
  • 고유명사 / 벤치마크: KatFish, "model attribution" 영문 병기 모두 유지
  • 장르 명: 학술·뉴스·SNS — 표기 / 순서 / 가운뎃점 동일
  • 의도된 학술 격식: "본 연구 / 본 논문 / 제안된 프레임워크 / 실험 결과 / 다음과 같이 요약된다" 모두 보존 — 학술 도메인의 톤 시그너처
  • 나열 격식: "첫째 / 둘째" 명시적 enumeration 유지

개선 포인트

  • 자연스러운 학술 격식 — "사료된다" 같은 강한 hedging 은 살리되, "활용하여 ~ 평가되었다" 같은 영어 학술 번역체 (passive ABBA) 는 능동으로 회복.
  • "이러한 / 다양한 / 또한" 약화 — 학술에서도 거품은 거품. 한 단락에 "이러한" 두 번 나오면 반복 인상.
  • 수치·고유명사 100% 보존 — 학술 도메인에서 가장 중요한 안전장치. 컴마·괄호·영문 병기 모두 글자 단위 동일.

한계

학술 abstract 는 "본 연구 / 본 논문 / 제안 방법 / 본 연구의 기여" 같은 정형 문구가 의도된 시그너처. humanizer 가 이걸 다 정리하면 학술 톤 자체가 깨진다. 이번 사례는 정형 문구는 보존하고 거품 표현 (이러한 / 또한 / 다양한 / ~될 수 있다) 만 정리. 카탈로그 부록 E (도메인 우선순위) 의 "학술" 항목도 같은 원칙.


학술 도메인 적용 가이드

  • 건드릴 것: 거품 표현 (#1, #2, #4), 영어 번역체 (#3), 과한 수동·hedging (#6, #11)
  • 건드리지 말 것: 정형 학술 문구 ("본 연구 / 다음과 같다 / 본 논문에서는"), 수치, 고유명사, 인용문, 강한 hedging ("사료된다 / 시사한다") 일부
  • 단락 cap 운용: 학술 abstract 는 보통 한 단락 = 한 문서. logical 단락 (서론·방법·결과·결론) 으로 나눠 cap 적용