- 월간 방문 수
- 0
- 가격
- 설정되지 않음
- 등록일
- —
- 업데이트됨
- 2026-09-11
01NeoHorse-1이란
NeoHorse-1은 기원 리듬(TokenRhythm)이 무문심궁, 칭화대, 베이징대, 홍콩중문대, 알리바바 등과 공동 출시한 오픈 소스 Agent 모델로, 4B와 9B 두 버전으로 제공됩니다. 모델은 Agent-Native 후훈련을 적용하고 Routing Harness의 실제 실행 궤적을 훈련 데이터로 사용하며, 라우팅 신호를 훈련 커리큘럼 정렬 기준으로 재활용해 평가 피드백→데이터 비율 조정→모델 업데이트의 폐쇄 루프를 구현합니다. 모델은 도구 호출, 작업 계획, 심층 검색 및 코드 생성을 지원하며, 9B 버전은 평균 69.04점으로 기반 모델보다 3.44점 높고, 26만 token 컨텍스트를 기본 지원하며 로컬 배포가 가능합니다.
02NeoHorse-1의 주요 기능
도구 호출: 작업 요구에 따라 외부 도구를 자동으로 선택하고 호출해 여러 단계의 작업을 수행합니다.
작업 계획: 복잡한 작업을 실행 가능한 하위 단계로 분해하고 장기 계획과 조정을 수행합니다.
심층 검색: 여러 차례의 상호작용에서 정보를 능동적으로 검색하고 통합해 결론을 뒷받침하는 증거 사슬을 구축합니다.
코드 생성: 사용 가능한 코드를 생성하고 환경 피드백을 바탕으로 디버깅 및 수정 작업을 수행해 작업을 완료합니다.
03NeoHorse-1의 기술 원리
WeChat에서 팔로우 후 “开源”라고 답장해 AI 오픈 소스 프로젝트 교류 그룹에 가입하세요.
Harness 궤적 기반 Agent-Native 훈련: 훈련 데이터는 Routing Harness의 실제 실행에서 생성된 구조화된 궤적을 핵심으로 하며, 요청, 라우팅, 도구 호출, 환경 피드백 및 오류 복구를 포함합니다. 기존 질의응답 데이터보다 능력 요구, 실행 의사결정, 환경 결과라는 세 가지 차원이 추가됩니다. 성공 및 실패 궤적을 모두 보존하고, 구조 검사와 6차원 품질 평가를 거쳐 선별함으로써 훈련 목표가 작업 완료를 직접 지향하도록 합니다.
능력 기반 데이터 비율 조정: 라우터는 작업을 능력 요구에 따라 C0–C3의 네 단계로 분류하며, 해당 신호를 오프라인에서 훈련 기준으로 재활용합니다. 라우팅 기록을 “예측—행동—결과”의 세 부분으로 나누고, 예측 부분으로 커리큘럼을 정렬하며 결과 부분으로 능력 부족을 파악합니다. 이를 바탕으로 다음 라운드의 데이터 비율을 조정해 평가 피드백→데이터 비율 조정→모델 업데이트의 폐쇄 루프를 구축합니다.
재귀적 자기 개선(RSI)의 단일 라운드 검증: Data-RSI와 Model-RSI의 두 부분으로 구성됩니다. 전자는 모델이 지속적으로 실행해 새로운 궤적을 생성하고, 이를 선별한 뒤 후속 훈련 자료로 자연스럽게 축적하는 방식입니다. 후자는 평가에서 확인된 부족한 능력에 따라 모델을 업데이트하고 Harness 모델 풀에 다시 투입하는 방식입니다. 현재는 단일 폐쇄 루프만 검증되었으며, 신호와 보상 설계는 여전히 사람이 설정합니다.
04NeoHorse-1 사용 방법
다운로드 도구 설치: pip install -U modelscope를 실행해 ModelScope 명령줄 도구를 설치합니다.
모델 다운로드: modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B를 실행해 가중치를 가져옵니다(4B 버전도 동일하며 필요에 따라 선택).
서비스 배포: SGLang(pip install "sglang==0.5.17")또는 vLLM을 사용해 추론 서비스를 시작하고, --context-length 262144, --reasoning-parser qwen3 및 --tool-call-parser qwen3_coder를 설정합니다.
API 호출: OpenAI SDK에서 base_url을 로컬 서비스 주소(예: http://localhost:8000/v1)로 지정하면 OpenAI API를 호출하는 것처럼 요청을 보낼 수 있습니다.
리소스 참고: 실제 사용 가능한 컨텍스트 길이는 GPU 메모리에 따라 달라지므로, 메모리가 부족하면 먼저 컨텍스트 길이를 낮춘 후 배포하세요.
05NeoHorse-1의 핵심 장점
Agent-Native 훈련: 훈련 데이터가 기존 질의응답 자료가 아닌 실제 실행 궤적에서 직접 생성되므로, 범용 모델의 사후 적용이 아니라 작업 완료를 직접 목표로 합니다.
실패 궤적 활용: 훈련 세트에 성공 기록과 교체된 실패 기록을 모두 보존해 모델이 “어디에서 실수하기 쉬운지, 오류 발생 후 어떻게 복구하는지” 학습하도록 합니다.
라우팅 신호 재활용: 온라인 라우팅의 C0–C3 능력 단계 신호를 오프라인에서 훈련 기준으로 변환해 “평가 피드백→데이터 비율 조정→모델 업데이트” 폐쇄 루프를 구현합니다.
소형 고성능: 4B 버전의 Agent 성능은 이미 더 많은 파라미터를 가진 여러 범용 모델을 능가하며, 9B 버전은 평균 69.04점으로 기반 모델보다 3.44점 높아 배포 비용이 낮습니다.
초장문 컨텍스트: 262,144 tokens를 기본 지원하고 약 101만 tokens까지 확장할 수 있어 장기 Agent 작업에 적합합니다.
06NeoHorse-1 프로젝트 주소
GitHub 저장소:https://github.com/TokenRhythm/NeoHorse
HuggingFace 모델 컬렉션:https://huggingface.co/collections/TokenRhythm/neohorse-1
arXiv 기술 논문:https://arxiv.org/pdf/2609.08183
07NeoHorse-1의 활용 시나리오
에이전트 작업 실행: OpenClaw 등의 Harness에서 실행 모델로 사용되어 파일 조작, 소프트웨어 사용과 같은 실제 컴퓨터 작업을 자동으로 수행하고 실패 후 스스로 복구합니다.
도구 호출 및 API 오케스트레이션: 여러 도구가 있는 환경에서 외부 API를 자동으로 선택, 조합 및 호출해 자동화 워크플로 어시스턴트 구축에 적합합니다.
심층 검색 및 연구 어시스턴트: 여러 차례 능동적으로 검색하고 정보를 교차 검증하며 증거 사슬을 첨부해 인용이 포함된 조사 보고서 생성을 지원합니다.
기업 업무 자동화: WorkBuddy Bench와 같은 다양한 직장 업무 시나리오에서 일정 조정, 데이터 정리, 보고서 생성 등 장기적인 다단계 작업을 처리합니다.
© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.


사용자 리뷰0