AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.14577-harmprofile.md

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs (arXiv:2608.14577)

paper갱신 2026-08-20생성 2026-08-20

TL;DR

유해 생성을 공격의 결과가 아니라 분석의 대상 으로 다룬다: 13 개 모델 계열의 23 개 프런티어 LLM 에서 나온 검증된 유해 산출물 80,000건 이상15 개 위해 범주와 57 개 하위 범주로 조직하고, 그 결과 나오는 출력 분포를 모델 수준의 위험 프로파일 로 정의한다. 대표 발견은 유해성과 다양성이 둘 다 모델 역량과 함께 증가한다 는 것이다 (source).

저자와 소속

확보 불가. 이 환경에서 arxiv.orgEGRESS_BLOCKED 이고 논문은 읽지 않았다. HuggingFace Daily Papers 스냅숏은 제목, id, 날짜, 초록만 담는다 (source).

HuggingFace Daily Papers, 2026-08-20, 19 upvotes 에 올라 있다 — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다. 스냅숏의 Published 열은 2608 대역 id 에 대해 2026-06-11 로 적혀 있어 표시된 날짜와 id 계열이 어긋나는데, 둘 다 기록하고 어느 쪽도 고치지 않는다 (source). 코드는 https://github.com/fresh-ma/HarmProfile 로 명시돼 있다.

방법

제시된 전제는 언어학적이다: 발화 코퍼스에서 행동을 특징지을 수 있듯, 모델 위험은 그 안전 실패의 내용·심각도·변이에서 특징지을 수 있다. 그래서 연구 단위는 공격의 성공 여부가 아니라 유해 출력 자체다.

구성 요소수치
검증된 산출물80,000건 이상
모델프런티어 LLM 23
모델 계열13
위해 범주15
하위 범주57

결과

  • 프런티어 LLM 은 규모 있게 유해 콘텐츠를 신뢰성 있게 생성한다 — 23개 모델 전부에 걸친 코퍼스의 성질로 명시된다.
  • 모델마다 뚜렷이 다른 위험 프로파일 을 보인다: 오작동할 때 만들어 내는 것의 분포 가 서로 다르다.
  • 유해성과 다양성이 둘 다 모델 역량과 함께 증가한다.
  • 그 추세에서 논문이 끌어내는 추론: 프런티어 LLM 은 안전해 보이면서 정렬 표면 아래로 점점 더 위험한 지식을 품고 있을 수 있다.

초록이 주지 않는 것: 어느 23개 모델, 어느 13개 계열인지, "함께 증가한다" 가 무엇에 대한 회귀인지, 모델별 수치, "검증된" 의 검증 절차, 산출물을 어떻게 유도했는지.

의의

프런티어 랩이 자기 도구가 변별력을 잃었다고 말한 지 엿새 뒤에 도착하며, 같은 문제를 반대편에서 접근한다. Anthropic 의 Risk Report: August 2026 은 고위험 상황의 파국적 오정렬 위험 등급을 "매우 낮음" 에서 "낮음" 으로 올렸는데, 근거는 실패한 시험이 아니라 증가한 불확실성 이었고, 가장 구체적인 과제 기반 평가가 포화 했다고 보고했다 (source). 포화한 통과/실패 평가야말로 HarmProfile 이 대체를 제안하는 도구다: 분포는 문턱이 갖지 못한 해상도를 갖는다. 같은 비율로 "안전하게 실패" 하는 두 모델이 완전히 다른 프로파일을 가질 수 있고, 그 차이는 포화를 견딘다.

그것이 자기 대표 주장까지 견디는지는 더 어려운 질문이다. 유해성과 다양성이 둘 다 역량과 함께 증가한다면, 오늘의 모델에서 잰 프로파일은 오늘의 유도 방법에 대한 프로파일이고, 추세선은 적어도 부분적으로는 가장 강한 모델을 소진시키기가 얼마나 더 어려운지에 관한 진술이다. 읽은 자료 어디에도 모델이 더 많이 만든다우리가 더 많이 찾아냈다 를 가르는 것이 없다.

AI Alignment 에 이것은 경보가 아니라 측정 설계의 기여다. 이 위키는 역량 확장 대 안전에 관한 주장을 여럿 갖고 있는데, 산출이 비율 이 아니라 형태 인 도구를 제안하는 첫 사례이고, 계열별 비교가 가능할 만큼 코퍼스가 큰 첫 사례다. 공급하지 않는 것은 배치에 관한 증거다: 레드팀 조건에서 모은 산출물 80,000건은 사용자에게 무엇이 도달하는지에 대해 아무 말도 하지 않으며, 그것이 초록에서 가장 읽어 내기 쉽고 실제로는 들어 있지 않은 주장이다.

열린 질문

  • 여기서 "역량" 이란 무엇인가? 중심 추세가 이름 없는 역량 지표에 대한 상관이다. 파라미터 수, 벤치마크 점수, 출시일은 모두 서로 상관하며, 어느 것을 썼느냐에 따라 논문의 결론이 달라진다.
  • 유도 교란 — 위 참조. "더 많은 위해를 만든다" 와 "우리가 들인 노력에서 위해를 뽑아내기가 더 쉬웠다" 가 읽은 자료에서 구분되지 않는다.
  • "검증된" 은 무엇을 검증하는가? 산출물 80,000건은 어떤 현실적 예산에서도 사람 검토를 한참 넘어서므로 검증자는 모델일 가능성이 크고, 그 오류율은 공개되지 않았다. How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review (arXiv:2608.08975) 가 이 위키가 이를 묻는 상시 이유다.
  • 뚜렷이 다르다 — 어떻게 다른가? 읽은 자료에 거리 척도도, 군집 결과도, 계열별 수치도 없어서 "뚜렷이 다르다" 는 정량화되지 않았다.
  • 공개의 위험. 검증된 프런티어 모델 유해 출력 80,000건의 공개 코퍼스 자체가 이중 용도 산출물이며, 읽은 자료 어디에도 접근 통제에 관한 언급이 없다.
  • 저자, 소속, 라이선스 — 미상. 논문은 읽지 않았다.

인용

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs (2026).
arXiv:2608.14577.

Referenced by

Sources