- Ziara za kila mwezi
- 0
- Bei
- Haijawekwa
- Imeorodheshwa
- —
- Imesasishwa
- 2026-09-16
01Iris ni nini
Iris ni wakala wa utafutaji wa akili uliotolewa kama chanzo huria na timu ya AllSpark ya Xiaohongshu, ukiwa na matoleo mawili: 35B (Iris-mini) na 397B (Iris-pro). Iris inaweza kuamua kwa kujitegemea itafute nini, isomeje na wakati wa kukamilisha jibu kwenye mtandao halisi. Hutengeneza data ya mafunzo yenye ugumu wa kutosha na inayoweza kutatuliwa kwa kuunda kinyume grafu ya maarifa kutoka kwa viungo vya kurasa za wavuti, kisha hutumia mbinu ya mafunzo ya SFT–RL Climbing inayobadilisha SFT na ujifunzaji wa kuimarisha. Imefikia matokeo bora zaidi miongoni mwa modeli huria zenye ukubwa sawa katika vigezo vinne vikuu vya BrowseComp, DeepSearchQA na HLE; toleo la 35B limekaribia modeli yenye vigezo trilioni, huku uwezo wa utafutaji ukihamishika kwenye kazi kama kuita zana za jumla.
02Kazi kuu za Iris
Utafutaji huru wa mtandao: Huamua yenyewe itafute nini, isomeje matokeo ya utafutaji na wakati wa kuendelea au kusitisha, huku ikitafuta, kufikiri na kujibu kwa wakati mmoja.
Kufikiri kwa hatua nyingi kwenye kurasa mbalimbali: Inaweza kubainisha jibu la kipekee hatua kwa hatua kutoka kwenye kurasa kadhaa za wavuti, badala ya kutumia njia ya mkato ya ulinganishaji wa maneno muhimu.
Utafutaji changamano wa Kichina na Kiingereza: Imefikia kiwango bora zaidi miongoni mwa modeli huria zenye ukubwa sawa katika kazi za utafutaji wa kurasa za wavuti za Kichina na Kiingereza kama BrowseComp na BrowseComp-ZH.
Maswali na majibu yanayofunika ushahidi: Hufunika kikamilifu mlolongo wa ushahidi inapojibu, na inaongoza katika DeepSearchQA.
Kutatua matatizo ya kiwango cha kitaalamu: Inaweza kushughulikia maswali magumu kama HLE yanayohitaji kufikiri kwa kiwango cha kitaalamu.
Usimamizi wa muktadha: Inaauni mikakati ya usimamizi wa muktadha kama kukata na kubana muktadha, hivyo utafutaji wa mfululizo mrefu haukatizwi; modeli ndogo hunufaika zaidi.
Uhamishaji wa uwezo: Bila mafunzo maalum, inaweza kutekeleza kazi kama kuita zana za jumla na ushirikiano wa ofisini.
03Kanuni ya kiteknolojia ya Iris
Fuatilia kupitia WeChat na ujibu “开源” ili ujiunge na kundi la mawasiliano la miradi huria ya AI
Uundaji wa data kwa kutengeneza maswali kinyume: Hutumia ukurasa wa mbegu kama jibu, hufuata viungo vya tovuti ili kuunda grafu ya maarifa ya huluki, kisha hutengeneza maswali yanayohitaji kufikiri kwa hatua nyingi kwenye kurasa mbalimbali. Hulenga kubadilisha huluki zote isipokuwa jibu katika swali kuwa marejeleo ya maelezo ili kuondoa vidokezo vinavyoweza kulinganishwa. Hatimaye, modeli rejea hufanya uchujaji wa mara mbili: huhifadhi tu maswali ambayo hayawezi kujibiwa bila kufungua ushahidi, lakini yana jibu moja sahihi yanapopewa ushahidi. Mchakato wote ni wa kiotomatiki na unaweza kupanuka kulingana na ukubwa wa korpasi.
Mafunzo ya kubadilishana SFT–RL Climbing: Katika hatua ya SFT, modeli yenye nguvu ya mwalimu hutengeneza mfululizo wa vitendo kwenye zana halisi za utafutaji, kisha modeli hufunzwa baada ya kuchuja matokeo na kuchuja kila hatua kwa “mwamuzi”. Katika hatua ya RL, modeli hutafuta na kujifunza kwa wakati mmoja kwenye mtandao halisi. Baada ya kila mzunguko, mfululizo ulio mgumu zaidi kujibu kwa usahihi na ule uliotatua kwa ufanisi zaidi hurudishwa kwenye SFT ya mzunguko unaofuata. Kadiri modeli inavyokuwa bora, maswali huwa magumu kiotomatiki, na hivyo kuunda mtaala unaojibadilisha.
Uhandisi wa mafunzo umejengeka ndani: Utoaji wa alama na muhtasari hukamilishwa na modeli zilizojengwa ndani ya klasta ya mafunzo, bila kutegemea API yoyote ya nje, hivyo kuzuia misukosuko ya mtandao kuathiri mzunguko wa mafunzo. Wakati huo huo, mafunzo na matumizi ya mtandaoni hutumia kifupisho kilekile, na kuondoa tofauti kati ya mafunzo na uelekezaji.
Kuendelea na uendeshaji wa mfululizo mrefu kutoka mahali paliposimama: Vipindi vichache virefu sana havitupwi tena kwa ukamilifu. Mchakato hukatizwa katika kiwango cha ombi, kisha hatua inayofuata huendelea kutoka kwenye sehemu iliyowasilishwa tayari, na kuwezesha GPU kudumisha matumizi ya juu chini ya upangaji sawia.
Itifaki ya tathmini iliyolinganishwa: Mifumo yote inayolinganishwa hutathminiwa kwa kutumia zana, muktadha, modeli ya utoaji alama na mkakati uleule wa usimamizi wa muktadha, huku ikitumia wakala mmoja wa ReAct pekee. Hii huondoa ujanja wa miundo kama mawakala wengi na kujithibitisha wakati wa majaribio, ili alama zionyeshe kwa uhalisia uwezo wa modeli yenyewe.
04Jinsi ya kutumia Iris
Clone hazina ya msimbo: Tekeleza git clone https://github.com/AllSpark-Research/Iris ili kupata msimbo wa uelekezaji na tathmini.
Pakua uzani wa modeli: Pakua uzani wa Iris-mini (35B) au Iris-pro (397B) kutoka kwenye mkusanyiko wa HuggingFace huggingface.co/collections/AllSpark-Research/iris.
Sanidi mazingira ya uendeshaji: Sakinisha vitegemezi kulingana na mahitaji ya hazina, kama miundo ya uelekezaji vLLM/SGLang, na usanidi kiolesura cha zana ya utafutaji. Utafutaji uliounganishwa na mtandao ni sharti la msingi kwa Search Agent.
Pakia modeli na uiunganishe na zana: Pakia modeli kwa muundo wa wakala wa ReAct na usajili injini ya utafutaji kama zana ambayo modeli inaweza kuita.
Uliza swali na uendeshe uelekezaji: Ingiza swali; modeli itapanga kiotomatiki hoja za utafutaji, isome kurasa za wavuti, ifanye fikra za hatua nyingi na kutoa jibu lenye ushahidi.
05Faida kuu za Iris
Matokeo bora zaidi miongoni mwa modeli huria zenye ukubwa sawa: Inaongoza kwa jumla dhidi ya modeli huria zenye ukubwa sawa katika vigezo vinne vya utafutaji vya BrowseComp, BrowseComp-ZH, DeepSearchQA na HLE; katika baadhi ya vipimo, Iris-pro ya 397B imezidi modeli zenye kiwango cha vigezo trilioni.
Ukubwa mdogo unaokaribia modeli kubwa sana: Iris-mini ya 35B imepata alama 82.2 kwenye BrowseComp, ikikaribia modeli kama Kimi-K2.6 zenye mara kadhaa zaidi ya vigezo, na kuonyesha kuwa modeli ndogo zinaweza kushindana na modeli kubwa sana katika nyanja maalum.
Uundaji wa data wa kiotomatiki na wa ubora wa juu: Hutengeneza maswali kinyume kutoka kwenye viungo vya kurasa za wavuti, huondoa vidokezo vinavyoweza kulinganishwa na kufanya uchujaji wa mara mbili ili kuhakikisha maswali yana ugumu wa kutosha na yanaweza kutatuliwa. Mchakato wote hauhitaji uundaji wa maswali kwa mikono na unaweza kupanuka bila kikomo kulingana na ukubwa wa korpasi.
Uhandisi wa mafunzo thabiti na wenye ufanisi: Utoaji wa alama na muhtasari vimejengeka ndani ya klasta ya mafunzo, hivyo kuondoa kabisa utegemezi wa API za nje. Kuendelea kwa mfululizo mrefu kutoka mahali paliposimama huiwezesha GPU kufanya kazi kwa mzigo wa juu, na kupunguza kwa kiasi kikubwa kutotabirika kwa mafunzo.
Mafunzo na matumizi ya mtandaoni yanafanana: Kifupisho cha maudhui ya utafutaji kinachotumiwa wakati wa mafunzo, tathmini na matumizi ya mtandaoni ni kilekile, kwa hiyo hakuna tofauti kati ya mafunzo na matumizi.
Uhamishaji wa uwezo na matumizi mapana: Uwezo wa utafutaji hujumuisha kazi ambazo hazikufundishwa maalum, kama kuita zana za jumla na ushirikiano wa ofisini. Search ni uwezo wa msingi unaoweza kutumiwa tena.
06Anwani za mradi wa Iris
Hazina ya GitHub: https://github.com/AllSpark-Research/Iris
Maktaba ya modeli ya HuggingFace: https://huggingface.co/collections/AllSpark-Research/iris
Waraka wa kiufundi wa arXiv: https://arxiv.org/pdf/2609.04304
07Matukio ya matumizi ya Iris
Utafiti wa kina/rapoti za utafiti: Utafutaji wa kiotomatiki wa raundi nyingi, kufikiri kwenye kurasa mbalimbali na kufunika ushahidi kikamilifu, unaofaa kwa bidhaa za Deep Research kama utafiti wa sekta, uchanganuzi wa washindani na utafiti wa kitaaluma.
Uhakiki changamano wa ukweli: Majibu yanahitaji kubainishwa hatua kwa hatua kutoka kwenye kurasa nyingi za wavuti, unaofaa kwa matukio kama kukanusha taarifa za uongo, uhakiki wa ukweli na uchunguzi wa kina ambapo chanzo lazima kipatikane.
Utafutaji wa lugha mbili wa Kichina na Kiingereza: Utendaji bora katika BrowseComp na BrowseComp-ZH, unaofaa kwa utafutaji wa taarifa za mipakani katika korpasi mchanganyiko ya Kichina na Kiingereza.
Wakala wa kuita zana za jumla: Uwezo wake unahamia kwenye kazi za General Tool Use kama BFCL na τ-bench, na unaweza kutumika kama msingi wa jumla wa bidhaa za Agent.
Ushirikiano wa ofisini (Cowork): Unaweza kutumika katika kazi za ofisini kama OfficeQA na APEX bila mafunzo maalum, na unafaa kuunganishwa kwenye msaidizi wa ofisi kwa kushughulikia maswali ya hati na kazi za mtiririko.
© Kanusho: vikoa na maudhui yaliyounganishwa vinaweza kubadilika kadiri muda unavyopita. AIEZZ haidhibiti tovuti za wahusika wengine. Kagua maudhui na hatari za nje kwa kujitegemea.


Ukaguzi wa watumiaji0