
앤트 그룹 바이링이 오늘 Hugging Face 플랫폼에서 Ling-3.0-tiny 모델을 오픈소스로 공개했다. 이 모델은 경량 하이브리드 추론 MoE 아키텍처로, 총 매개변수는 7.9B이며 토큰당 1.3B개의 매개변수를 활성화한다. 공식적으로 BF16, FP8, INT4 가중치 버전을 제공해 다양한 플랫폼의 배포 요구에 대응한다.

소개에 따르면 Ling-3.0-tiny는 저비용 추론을 목표로 하며, 효율적인 하이브리드 선형 아키텍처를 채택했다. KDA(Kimi Delta Attention)와 MLA(Multi-Head Latent Attention, 다중 헤드 잠재 어텐션)를 3:1 비율로 교차 적층한다. 128개의 라우팅 전문가(routed experts)를 포함하는 희소 MoE 피드포워드 네트워크(FFN)를 사용해 컨텍스트 처리 능력과 연산 비용 사이의 균형을 맞췄다.
이 모델은 빠른 응답 모드와 다단계 추론 모드를 지원하며, 로컬 배포를 위해 설계됐다. 공식적으로 엔비디아 DGX Spark, Apple Silicon MacBook, Mac mini 등 컴퓨터에서 검증을 완료했다. M4 Pro MacBook에서는 약 86~90 Token/s의 추론 속도를 달성할 수 있으며, 8K 컨텍스트 길이에서 피크 메모리 사용량은 약 8.34 GiB다.
참고:
inclusionAI/Ling-3.0-tiny · Hugging Face
