OpenClaw와 Hermes Agent, 지금 옮겨야 할까? 기능·보안·사용자 평가 비교
요약. 2026년 9월 23일 확인한 최신 안정판은 OpenClaw v2026.9.5와 Hermes Agent v0.21.3이다. 둘 다 메신저, 여러 AI 모델, 기억, 스킬, 예약 작업을 연결한다. 선택을 가르는 것은 이름보다 지금 쓰는 채널과 자동화가 그대로 동작하는지, 권한을 어디까지 줄지, 실제 완료 비용이 얼마인지다. 최근에도 Hermes로 옮긴다는 후기는 있지만 되돌아오거나 병행하는 사용자도 있다. 현재의 공개 후기만으로 전체 사용자 이동률을 계산할 수 없다.
먼저 버전부터 맞추자
흔히 말하는 OpenClaw 2.0은 공식 문서에서 v2026.8.1을 가리킨다. 이번 비교는 그 뒤에 나온 v2026.9.5를 대상으로 한다. 이 판에는 업데이트 전 새 버전을 검사하는 Atomic Updates, 재시작 없는 일부 플러그인 설치, 전문 에이전트 팀 설정, 회의·통화의 GPT Live 지원 등이 들어갔다. Hermes v0.21.3은 원격 데스크톱·클라우드 대시보드 로그인 갱신 오류와 오래 실행한 프로세스의 데이터베이스 연결 누수를 고친 안정판이다. Hermes의 개발 브랜치에만 있는 기능을 안정판의 확정 기능으로 세지 않았다. OpenClaw 릴리스 노트 · Hermes 릴리스 노트
두 에이전트가 실제로 하는 일
두 제품 모두 사용자가 메신저에서 지시하면 연결된 모델이 작업을 계획하고 허용된 도구로 파일·웹·서비스를 다루는 개인 에이전트 실행 환경이다. 모델 자체의 성능 비교와 구분해야 한다. 예를 들어 같은 Claude 모델을 두 제품에 연결해도 기억을 불러오는 방식, 도구 목록, 재시도 횟수에 따라 결과와 토큰 사용량이 달라진다. 아래는 공식 문서에 나온 기능과 사용 조건이다. OpenClaw 소개 · Hermes 소개
| 작업 | OpenClaw v2026.9.5 | Hermes v0.21.3 |
|---|---|---|
| 대화·운영 화면 | Control UI에서 채팅·설정·세션을 관리하고 여러 메신저 채널을 묶는다. 팀원별 에이전트와 채널 라우팅을 세밀하게 나눌 수 있다. | CLI·데스크톱·웹 대시보드에서 채팅, 세션, 비용, 예약 작업과 프로필을 관리한다. Telegram·Discord·Slack·WhatsApp·Signal 등 게이트웨이를 제공한다. |
| 기억 찾기 | 파일 기반 기억을 의미·키워드로 검색한다. 임베딩 제공자를 설정하면 혼합 검색을 사용하며, 제공자가 없으면 키워드 검색만 한다. 대화 간 기억은 개인 설치 기본값과 DM 격리 설정에 따라 다르다. | 지속 기억과 전체 세션의 검색을 분리한다. 세션 기록은 SQLite에 보관하고 검색·내보내기·정리를 지원한다. 무엇을 기억으로 승격할지는 기억·스킬 설정의 영향을 받는다. |
| 스킬 학습 | Skill Workshop에서 반복 작업을 스킬로 만들고 제안·적용을 관리한다. 기본 자동 모드에서는 직접 수정할 수 있어 검토 정책을 별도로 바꿔야 한다. | 작업 경험을 스킬로 작성·수정하고 공유 가능한 스킬 형식을 사용한다. 기본값에서는 쓰기 승인이 꺼져 있으며 승인 옵션으로 변경안을 보류할 수 있다. |
| 예약 실행 | 예약 작업과 백그라운드 작업을 운용한다. 여러 전문 에이전트를 연결한 흐름이 강점이다. | 반복·일회성 예약, 웹훅으로 즉시 실행, 결과를 메신저나 파일로 전달한다. 스크립트만 실행하는 예약은 LLM 호출 없이도 가능하다. |
| 팀·위임 | 에이전트별 작업 공간·모델·도구 정책과 메시지 라우팅을 구성하고 하위 에이전트를 실행한다. | 프로필별 설정·스킬·세션을 분리하고 하위 에이전트에 일을 나눈다. 그룹 채팅의 전문 Bot 구성도 제공한다. |
| 웹·외부 도구 | 브라우저 제어, 도구·플러그인, MCP 연결을 구성한다. 브라우저에는 별도 프로필을 권장한다. | 브라우저·검색·이미지·음성·MCP 도구를 구성한다. Nous Portal의 통합 도구는 유료 구독 조건을 확인해야 한다. |
| 모델·인증 | 제공자별 구독 로그인, API 키, 로컬 모델을 선택한다. 하위 에이전트에는 다른 모델을 지정할 수 있다. | Nous Portal, API 키, OpenRouter, 로컬 모델 등을 선택한다. 제공자·계정을 바꾸면 캐시와 청구 경로도 달라진다. |
기능 목록만 보면 둘 다 거의 모든 일을 할 수 있다. 차이는 설정의 기본값과 운용 단위에서 나타난다. OpenClaw의 기억 검색은 임베딩 제공자와 대화 가시성 설정을, Hermes의 기억·세션은 기억 문서와 세션 보존 정책을 확인해야 한다. 자동화도 OpenClaw의 하위 에이전트와 Hermes의 예약 작업은 별도 세션·도구·모델 비용을 만들 수 있다. 웹 화면은 두 제품 모두 있으므로 화면 유무만으로 고르면 틀린 판단이 된다. Hermes 대시보드 · OpenClaw Control UI
스킬을 스스로 고치는 방식은 설정까지 봐야 한다. OpenClaw는 Skill Workshop의 자동 학습 모드와 승인 정책 기본값이 모두 auto다. 필요하면 제안만 남기는 모드와 운영자 승인을 고를 수 있다. Hermes도 스킬 쓰기 승인의 기본값이 꺼져 있어 에이전트가 스킬을 직접 고칠 수 있다. skills.write_approval: true를 설정하면 변경안을 확인한 뒤 적용한다. 오래 쓸 개인 비서라면 어느 쪽이든 첫날에 기억·스킬 변경 기록과 승인 설정을 확인할 필요가 있다.
무료 소프트웨어여도 사용료는 생긴다
두 저장소의 프로그램 설치비와 모델 사용료는 구분된다. 직접 API 키를 연결하면 모델 제공자의 토큰·도구 요금이 청구된다. 구독 로그인은 해당 제공자의 허용량·추가 사용량 정책을 따른다. 서버나 유료 검색·음성 도구를 쓰면 그 비용도 붙는다. OpenClaw의 사용량 화면과 Hermes의 /usage 명령은 지출을 추적하는 데 유용하지만, 화면의 추정액을 카드 청구서로 취급하면 안 된다. OpenClaw 문서는 로컬 세션 기록이 제공자 청구서가 아니라고 명시한다.
결제에서 특히 조심할 경로는 Hermes의 Anthropic OAuth다. Hermes 공식 문서는 Claude Max의 추가 사용량 크레딧이 필요하며 기본 Max 허용량이 아닌 추가 사용량에서 차감된다고 설명한다. Claude Pro에서는 이 경로가 작동하지 않는다고도 적었다. 실제로 구독에 포함된 사용량을 예상했다가 추가 사용량 청구를 보고한 사용자 이슈가 있다. Claude 모델을 Hermes에 연결할 때는 현재 인증 조건을 읽고, 첫 짧은 작업 뒤 제공자 계정의 사용량 화면을 확인하자. OpenClaw는 ChatGPT/Codex 구독 허용량과 OpenAI API 청구액을 별도로 표시한다. 두 제품 모두 인증 방법이 달라지면 비용 경로도 달라진다.
작업비를 직접 비교한다면 같은 모델과 같은 API 계정으로 예를 들어 이메일 20건을 분류하고, 정답으로 끝난 건수·전체 입력/출력·캐시 토큰·재시도·보조 호출을 기록한다. 예상 결과는 ‘20건 처리에 몇 달러’와 ‘성공 1건에 몇 달러’다. Hermes의 일회성 실행 보고서는 보조 작업 비용을 별도 항목으로 내고 합계도 제공한다. 모델이나 계정을 바꿔 가며 시험하면 캐시가 초기화되어 비용 비교가 흔들릴 수 있다. Hermes 캐시 안내
오류·보안·결제 이력은 무엇이 확인됐나
먼저 용어를 구분하자. 취약점은 공격이 가능한 코드 경로가 확인됐다는 뜻이고, 침해 사고는 실제 악용·피해가 확인됐다는 뜻이다. 공개 감사의 발견, 수정된 취약점, 사용자 신고를 사고 건수로 합산할 수 없다. 아래 표는 공격 경로, 가능한 영향, 수정 상태를 따로 적었다.
| 사례 | 경로·영향 | 현재 상태와 조치 | 근거 |
|---|---|---|---|
| OpenClaw 권한 전파 | 제한된 요청이 후속 작업을 만들 때 원래 권한이 빠지면, 뒤의 작업이 더 넓은 도구에 접근할 수 있었다. | 9월 공개 감사에서 발견. 조치 대상은 v2026.8.1과 v2026.7.33 LTS에 반영됐다고 프로젝트가 밝혔다. 작업 시작자와 하위 작업의 권한을 함께 점검한다. | 감사 요약 |
| OpenClaw 검사 대상 불일치 | 압축 파일 일부만 검사하고 전체를 푸는 경우, 승인 뒤 파일 경로가 달라지는 경우가 확인됐다. 승인받은 대상과 실제 사용 대상이 달라지는 위험이다. | 실제로 쓸 파일·경로에 승인을 묶고 변하면 재검사하도록 수정했다고 밝혔다. 오래된 판은 갱신한다. | 감사 요약 |
| OpenClaw 권한 철회 지연 | 실행 중 기억 접근을 끄더라도 그 실행이 종료될 때까지 계속 기억을 읽을 수 있었다. 이미 허용된 작업의 중간 철회가 늦게 반영된 사례다. | 도구가 실제 작동할 때 현재 설정을 다시 확인하도록 수정했다고 밝혔다. 감사 전체 24개 등급 보고서 중 23개가 확인된 취약점이었으나 공개된 실제 침해 건수는 아니다. | 감사 요약 |
| Hermes 제공자 간 API 키 노출 | 0.14.x에서 사용자 지정 모델 주소에 명시 키가 없을 때 OpenAI·OpenRouter 키를 다른 제공자 주소로 보내는 경로가 신고·재현됐다. 키가 다른 사업자에게 전달될 수 있었다. | 5월 21일 주소별 키 선택을 강제하는 수정 PR이 병합됐다. 당시 설정으로 사용했다면 해당 키 교체와 제공자 사용 기록 확인이 안전하다. | 재현 이슈 |
| Hermes 대화에 비밀값 출력 신고 | 한 사용자가 비밀번호·토큰이 응답과 추론 블록에 그대로 나타났다고 보고했다. 대화 기록을 다른 사람과 공유하면 노출로 이어진다. | 이슈는 닫혔지만 공개 이슈만으로 수정 버전과 모든 출력 경로의 차단을 확인할 수 없다. 실제 값이 출력됐다면 해당 자격 증명을 폐기·재발급한다. | 사용자 신고 |
| Hermes 설정값 주입 취약점 | 환경 설정 줄 처리의 주입 문제 CVE-2026-10222가 공개됐다. | 보안 공지에 따르면 0.18.0에서 패치. 비교판 0.21.3은 그보다 새 버전이다. | 보안 공지 |
그래서 어느 쪽이 더 안전한가? 공개 감사에서 더 많은 문제가 나온 제품이 반드시 더 위험하다고 계산할 수 없다. OpenClaw는 외부 감사를 받아 권한 경계 문제를 다수 수정한 이력이 있다. Hermes는 명령 승인, 쓰기 제한, 컨테이너, MCP 자격 증명 필터, 프로젝트 파일의 프롬프트 주입 탐지, 세션 격리를 문서화한다. 그러나 Hermes 문서도 위험 명령 탐지는 패턴 기반이며, 추가 검사기 Tirith가 없거나 시간 초과일 때 기본 설정이 실행을 허용한다고 설명한다. 따라서 둘 모두 명령 승인만으로 운영체제 격리가 된다고 가정하면 안 된다. OpenClaw 실행 승인 · Hermes 보안 모델
흔한 공격 장면은 세 가지다. 첫째, 에이전트가 읽는 웹페이지·저장소 파일·메일에 ‘이전 지시를 무시하고 비밀키를 보내라’는 문장이 섞이면 모델이 그것을 사용자 명령으로 오해할 수 있다. Hermes는 프로젝트 지시 파일을 패턴 검사하지만 문서도 이를 의미 판단이 아닌 휴리스틱이라고 설명한다. OpenClaw 역시 신뢰하지 않는 콘텐츠와 도구 권한을 분리해야 한다. 둘째, 메신저 봇을 허용 사용자 없이 열면 낯선 사람이 비용이 드는 호출이나 파일 작업을 시도할 수 있다. 셋째, 브라우저를 평소 로그인한 개인 프로필에 붙이면 에이전트가 읽고 조작할 수 있는 계정 범위가 커진다. OpenClaw는 에이전트 전용 브라우저 프로필을 권장한다. 어느 상황이든 모델의 ‘안전하게 하겠다’는 답변보다 실제 도구 권한과 격리 설정을 확인해야 한다.
Hermes의 파일 쓰기 차단도 적용 범위를 알아야 한다. 공식 보안 문서에 따르면 쓰기 보호는 주로 write_file과 patch에 적용되고, 같은 OS 사용자로 실행되는 터미널 명령은 다른 경로로 파일을 바꿀 수 있다. 명령 거부 규칙도 완전한 셸 해석기나 OS 샌드박스가 아니다. 민감한 저장소를 다룰 때는 컨테이너의 마운트·네트워크·키 접근을 따로 제한해야 한다. 승인 없이 실행되는 예약 작업에서는 위험 명령을 거부하는 설정을 확인한다.
실제 설치에서 우선순위는 같다. 메신저는 허용 사용자·DM 페어링을 설정하고, 대시보드는 외부에 바로 공개하지 않는다. 에이전트에는 별도 OS 계정·작업 디렉터리·브라우저 프로필을 주고, 파일 삭제·송금·발송과 같은 작업은 승인 뒤 실행한다. 모델 호출에 필요한 키만 제공하며 권한 범위가 작은 별도 키를 쓴다. OpenClaw는 Gateway 한 개를 서로 불신하는 여러 사용자의 보안 경계로 보지 않는다. Hermes의 대시보드는 로컬 주소가 아닌 곳에 바인딩하면 인증이 필요하다. 팀원 간 신뢰 경계가 다르면 어느 쪽이든 설치·자격 증명·작업 공간을 분리해야 한다.
오류와 결제도 별도로 본다. OpenClaw의 과거 Gateway 연결 실패 신고가 최신판 전체의 오류율을 뜻하지는 않는다. v2026.9.5는 업데이트 전 검사와 복구 절차를 강화했다. Hermes v0.21.3은 원격 대시보드 세션 만료와 오래 실행한 프로세스의 DB 연결 누수를 고쳤다. Claude Max를 Hermes에 연결할 때의 추가 사용량 청구는 공식 인증 문서가 설명하는 결제 조건이며, 무단 결제가 확인된 사고라고 표현할 근거는 없다.
사용자들은 어떻게 평가하나
2026년 9월에도 OpenClaw 업데이트 부담 때문에 Hermes를 시험·이전했다는 글이 나온다. 예를 들어 9월 13일 업데이트 토론에는 이전 뒤 기존 작업이 돌아갔다는 경험담이 있다. 그러나 9월 20일 비교 토론에는 Hermes가 더 안정적이라는 반응과 OpenClaw의 긴 예약 자동화·Telegram 토픽 구성이 더 맞는다는 반응이 함께 있다. 댓글은 자발적으로 글을 쓰는 사람들의 표본이므로 이전 규모나 전체 장애율을 나타내지 않는다.
| 사용자·맥락 | 좋게 본 점 | 아쉬운 점 | 원문 |
|---|---|---|---|
| 9월 OpenClaw 업데이트 사용자 | 업데이트 후 설정·Gateway 문제를 겪어 Hermes 시험을 고려 | 업데이트 불만은 실제 경험이지만 모든 설치의 재현 문제로 볼 수 없음 | 9월 8일 토론 |
| 9월 장기 병행 사용자 | Hermes를 더 안정적으로 느꼈고 처음부터 시작한다면 택하겠다고 평가 | 이미 만든 OpenClaw 인프라 때문에 실제 주력은 OpenClaw로 유지 | 9월 20일 토론 |
| 9월 예약 작업 18개 병행 사용자 | Hermes가 비정형 코딩·탐색의 여러 단계 지시를 잘 따른다고 평가 | 장기 무인 예약 작업은 본인 환경에서 OpenClaw가 더 예측 가능했다고 보고 | 9월 20일 토론 |
| 9월 다른 병행 사용자 | Hermes의 기억 갱신은 만족 | 동일인이 자신의 설정에서 Hermes 작업이 30분, OpenClaw 작업이 5분 걸렸다고 보고. 성능 벤치마크는 아님 | 9월 20일 토론 |
| 이전 사용자 | Hermes의 기억·스킬 흐름을 좋게 평가 | 한 사례에서 OpenClaw가 10~20% 적은 토큰을 썼고 긴 대화를 더 잘 유지했다고 보고 | 하루 병행 시험 |
이용자 평가는 모델, 메모리 상태, 도구, 운영체제, 업데이트 판이 다르면 쉽게 뒤집힌다. 위의 10~20% 토큰 차이와 5분 대 30분은 각자의 환경에서 나온 관찰이다. 사용자 평가에서 읽을 수 있는 신호는 ‘누가 어떤 조건에서 만족했는가’까지다.
OpenClaw에서 Hermes로 이동하는 흐름은 계속되나
9월에도 이동 시도는 이어진다. 업데이트 장애를 겪고 옮겼다는 직접 후기와 이동 이유를 묻는 최근 토론이 있다. 동시에 안정된 OpenClaw 설정을 계속 쓰는 장기 이용자, 두 제품을 병행하는 이용자, Hermes 속도에 실망한 이용자도 보인다. 아래 표처럼 Hermes가 최근 더 많은 새 별을 받고 있지만, 별을 누른 사람이 OpenClaw를 떠났는지는 알 수 없다. 두 프로젝트의 설치·탈퇴·복귀를 같은 기준으로 집계한 공개 자료는 찾지 못했다. ‘대거 이전’이나 ‘이미 끝난 유행’ 어느 쪽도 확인된 통계로 말할 수 없다.
이전 도구도 일방통행이 아니다. Hermes의 OpenClaw 가져오기는 hermes claw migrate --dry-run으로 기억·스킬·호환 설정의 이전 계획을 보여준다. 기본값은 비밀키를 옮기지 않고 적용 전에 Hermes 상태를 백업한다. WhatsApp은 다시 페어링해야 하며, OpenClaw의 세션 수명·스레드 바인딩·전송 정책 같은 고급 설정은 그대로 옮겨지지 않는다. OpenClaw에도 Hermes에서 가져오는 명령이 있다. 실제 이전은 미리보기 결과를 읽고, 두 환경을 일정 기간 병행하면서 핵심 채널·예약 작업·권한을 하나씩 검증하는 편이 낫다. 원본 데이터는 검증 전까지 유지한다.
요즘 관심은 어디로 늘고 있나
누적 별은 오래된 저장소에 유리하므로 최근 신규 별로 바꿔 보자. GitHub의 공식 별 기록 API에서 2026년 9월 23일 조회한 값이다. 집계 기간은 GitHub가 8월 23일·30일, 9월 6일·13일 시작으로 표시한 완결된 4개 주(28일)다. 아직 끝나지 않은 9월 20일 시작 주는 제외했다. 이 API는 별을 새로 누른 횟수를 제공하므로 아래 수치는 별 취소까지 반영한 순증이나 실제 사용자 증가율이 아니다. 주 경계도 UTC와 정확히 일치한다고 보장되지 않는다.
| 저장소 | 최근 4주 신규 | 최근 1주 신규 | 전주 대비 |
|---|---|---|---|
| Hermes Agent | 13,676 | 2,511 | −19.1% |
| OpenClaw | 4,723 | 983 | −5.2% |
| ZeroClaw | 342 | 97 | +14.1% |
| NanoClaw | 294 | 72 | +14.3% |
| PicoClaw | 209 | 51 | −3.8% |
| IronClaw | 82 | 11 | −57.7% |
최근 1주에 Hermes는 OpenClaw보다 약 2.6배 많은 새 별을 받았다. 두 제품 모두 전주 대비 신규 별 수는 줄었다. 작은 저장소 중 ZeroClaw·NanoClaw는 전주 대비 늘었지만 절대 증가량은 각각 97개·72개다. 숫자는 관심의 방향을 보여줄 뿐, 설치 후 계속 쓰는 비율이나 보안·작업 성능을 증명하지 않는다. Hermes 원자료 · OpenClaw 원자료 · ZeroClaw · NanoClaw · PicoClaw · IronClaw
어느 쪽부터 시험할까
추천은 순위를 매기는 대신 지금 하려는 일과 바꾸는 비용을 함께 따져야 한다. 아래 판단은 제품의 공식 기능과 위 사용자 후기를 합친 해석이다.
| 사용자 상황 | 먼저 고를 쪽 | 판단 이유와 바뀌는 조건 |
|---|---|---|
| 처음 설치하며 대화로 개인 업무를 가르칠 사람 | Hermes 먼저 시험 | CLI·대시보드, 세션 검색, 스킬 축적, 예약 작업을 한 흐름에서 시험하기 쉽다. 필요한 메신저·브라우저·모델의 실제 연결 여부는 설치 전에 확인한다. |
| Telegram 토픽, 여러 채널, 전문 에이전트 분기를 이미 운영하는 사람 | OpenClaw 유지 | 현재 라우팅·예약 작업이 안정적이면 이전으로 얻는 이익을 먼저 측정해야 한다. Hermes의 이전 도구는 고급 세션·스레드 설정까지 그대로 복원하지 않는다. |
| 터미널에서 수시로 조사·코딩·문서 작업을 시키는 사람 | Hermes 병행 시험 | 스킬·기억·하위 작업의 체감 이득을 10~20건 같은 과제로 본다. 호출 수·완료 시간·정답률·성공 건당 비용이 기존보다 나을 때 옮긴다. |
| 장기 무인 예약 작업이 수십 개 있는 사람 | 현재 안정된 쪽 유지 | 작업 누락·중복 실행·실패 알림·복구 시간을 먼저 비교한다. Hermes의 LLM 없는 예약 작업이 유용할 수 있지만, 기존 작업의 안정성을 자동으로 보장하지는 않는다. |
| 민감한 메일·파일·결제 시스템을 연결하는 운영자 | 둘 다 격리된 시험부터 | 별도 계정·제한된 키·승인·컨테이너·접속 허용 목록을 설정할 수 있어야 한다. 조직의 다른 사용자와 한 설치를 공유하는 경우에는 보안 경계부터 분리한다. |
| API 비용에 민감한 사람 | 같은 모델로 직접 측정 | 로컬 모델·저가 모델·캐시와 보조 호출에 따라 결과가 바뀐다. Hermes의 Claude Max 인증은 추가 사용량 청구 조건을 확인한다. |
첫 시험에서는 같은 모델·계정·입력 자료·권한으로 작은 업무 10~20건을 처리한다. 각 작업의 성공 여부, 사람이 고친 시간, 재시도, 완료 시간, 전체 토큰과 제공자 청구액을 기록한다. 예를 들어 20건 중 A가 18건을 끝내고 6달러, B가 15건을 끝내고 4달러를 썼다면 성공 건당 비용은 각각 약 0.33달러와 0.27달러다. A의 성공률이 필요한 업무라면 추가 비용에 의미가 있고, B의 실패를 사람이 쉽게 고칠 수 있다면 판단이 달라진다. 이 수치는 계산 예시이며 두 제품의 측정 결과가 아니다. 이 글은 두 제품을 직접 설치해 동일 과제를 실행한 벤치마크가 아니라 9월 23일의 공식 문서·공개 이슈·사용자 기록을 비교한 것이다.