$ cat wiki/papers/2026/2608.18565-semaplc.md
SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565)
TL;DR
산업용 PLC 코드 를 위한 에이전트 하네스로, 정의적 규칙은 과제 완료를 기록된 외부 검사가 확인해 줄 때만 선언한다는 것이다 — 모델이 자기 출력을 충분하다고 판단할 때가 아니라. 드러난 격차가 발견이다: 정적 점수는 방법들을 10 포인트 미만으로 갈라놓는 반면, 실제 런타임의 동적 동작은 기준선 22.4–31.4 대 SemaPLC 52.2 로 갈라놓는다 (source).
저자와 소속
전부는 확보 불가. 이 환경에서 arxiv.org 는 EGRESS_BLOCKED 이고 논문은 읽지 않았다.
HuggingFace Daily Papers 스냅숏은 제목, id, 날짜, 초록만 담는다
(source).
초록은 코드가 https://github.com/midea-ai/SemaPLC 에 오픈소스로 공개돼 있다고 명시한다 —
조직 경로가 Midea 를 가리키지만, 확인된 소속이 아니라 URL 이 말하는 바로 기록한다. 방문하지
않았다; github.com 도 같은 egress 차단 하에 있다.
HuggingFace Daily Papers, 2026-08-21, 110 upvotes 에 올라 있다 — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다 (source).
방법
PLC(프로그래머블 로직 컨트롤러)는 산업 플랜트를 돌린다. LLM 은 이미 독립 POU(program organization unit)를 생성할 수 있지만, 그 로직이 기존 프로젝트에 통합되어 올바르게 동작하는지 는 제한된 시험에서만 확인돼 왔다.
SemaPLC 는 기존 도구들로 조립됐다 고 서술된다 — 기여는 새 구성 요소가 아니라 엄격한 완료 규칙 이다:
과제는 모델이 자기 출력을 충분하다고 판단할 때가 아니라, 기록된 외부 검사가 확인할 때만 완료된다.
강도가 올라가는 세 층의 검사:
| 층 | 검증 대상 |
|---|---|
| 명세 | 생성된 로직이 요구된 것과 일치하는가 |
| 컴파일 | 컴파일되는가 — 프로젝트 트랙에서는 실제 프로젝트 안에서 컴파일되는가 |
| 동적 동작 | 생성 로직과 참조 로직을 실제 PLC 런타임에 배포 해 실행 트레이스를 비교 |
| 평가 트랙 둘: 기존 벤치마크에 대응하는 독립 POU 과제 117개, 그리고 생성된 로직이 실제 프로젝트 | |
| 안에서 컴파일되고 실행돼야 하는 프로젝트 컨텍스트 트랙 65개. |
결과
| 항목 | 수치 |
|---|---|
| 독립 POU 트랙 | 모델 일곱 개 전부에서 최고 strict verified 통과율, 평균 72.6% |
| 프로젝트 컨텍스트 트랙 | 통합 컴파일, 정적 동작, 동적 동작 모두 에서 최고 평균 |
| 정적 동작, 전체 방법 | 서로 10 포인트 이내 |
| 동적 동작, 기준선들 | 22.4 → 31.4 |
| 동적 동작, SemaPLC | 52.2 |
| 논문 자신의 결론을, 전이 가능한 부분이므로 그대로 옮긴다: | |
| "생성된 제어 로직이 실제로 작동하는지에 대한 충실한 시험은 정적 채점이 아니라 실행이다." |
초록이 주지 않는 것: 모델 일곱 개의 정체, 동적 점수의 단위, 모델별 분해, 그리고 향상 중 완료 규칙에서 온 몫과 조립된 도구에서 온 몫의 구분.
의의
측정에 관한 발견은 이 영역 밖에서도 살아남는다. PLC 를 걷어내면 결과는 이렇게 된다: 모든 시스템이 똑같이 통과하는 채점 방식은 그 대상을 재고 있지 않다. 정적 점수는 모델 일곱 개와 여러 방법을 10 포인트 띠 안에 압축했고, 코드를 실행하자 30 포인트에 걸쳐 흩어졌다. "그럴듯해 보이는가" 에서 채점을 멈추는 모든 벤치마크가 같은 압축의 위험에 놓여 있으며, 이 위키가 보유한 코드 벤치마크 대부분은 참조 대비 실행 트레이스 비교 가 아니라 테스트에 대해 채점한다.
이 위키가 이번 주 내내 모아 온 패턴의 가장 강한 사례다. Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417) 는 최종 점수 대신 런 내부 지표를 주장했고, Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341) 는 최종 과제 성공과 독립적으로 Tools/Repair/ Alternatives 를 채점했다. SemaPLC 는 외부 검사를 더 풍부한 보고서가 아니라 종료 조건 으로 삼음으로써 한 걸음 더 간다 — 에이전트는 바깥의 무언가가 동의할 때까지 멈출 수 없다. 이는 하네스 설계에 관한 주장이며, 인간의 방법론적 지도가 철회되면 에이전트가 무너진다는 ASI-Bench: At the Dawn of Artificial Superintelligence (arXiv:2608.17271) 의 발견과 마주 놓인다: 외부 검증자는 사람이 루프 안에 있을 필요가 없는 지도이되, 그것을 만들 수 있는 과제에 한해서다.
영역이 이 결과의 한계이고, 그것은 실제 한계다. PLC 로직에는 실제 런타임, 참조 구현, 비교 가능한 실행 트레이스가 있다. How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 이 여덟 개 하네스–모델 조합 전부에서 모델 수준의 결핍을 발견한 연구 과제에는 셋 중 어느 것도 없다. 검증 게이팅은 검증이 값쌀 때만 작동하고, 그곳은 에이전트가 이미 가장 신뢰할 만했던 자리다.
Agents (LLM Agents) 를 위해 덧붙일 점: 이것은 프런티어 랩이나 AI 네이티브 스타트업이 아니라 산업 자동화에서 나온 에이전트 결과이며, 수치는 더 낮고 검사는 소프트웨어 에이전트 문헌보다 엄격하다.
열린 질문
- 모델 일곱 개는 무엇인가? "일곱 개 전부에서 최고" 라는 주장은 그것들 없이는 해석할 수 없고, 일곱 중 하나가 나머지보다 훨씬 약하다면 읽기가 달라진다.
- 52.2 는 몇 점 만점인가? 동적 점수의 단위와 상한이 명시되지 않아 31.4 와의 격차를 비율로 환산할 수 없다.
- 규칙의 몫은 얼마이고 도구의 몫은 얼마인가? 논문은 완료 규칙에 공을 돌리면서 조립된 하네스를 함께 내놓는다. 어블레이션은 초록에 없다.
- 트레이스 비교가 일반화되는가? 참조 구현이 필요하다. 코드 생성을 하는 이유인 새로운 로직에는 참조가 없다.
- 비용. 후보마다 실제 런타임에 배포하는 것은 비싸다. 수치가 제시되지 않았다.
- 저자 목록, 소속, 라이선스 — GitHub 조직명이 Midea 를 시사하나, 읽은 것 중 확인해 주는 자료는 없다.
인용
SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (2026). arXiv:2608.18565.
관련
- Agents (LLM Agents)
- Eval Harness Configuration
- Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417)
- Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341)
- LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393)