2026년 세계 인공 지능 회의(WAIC 2026)에서 많은 기업들이 토큰(AI가 처리하는 기본 데이터 단위) 처리 비용을 줄이는 것이 전체 AI 산업 사슬의 공통 목표가 되고 있다고 밝혔습니다. 칩, 컴퓨팅 인프라에서 AI 모델 및 스마트 라우팅(각 작업에 적합한 AI 모델을 자동으로 선택하는 시스템)에 이르기까지 효율성을 높이고 상용화를 촉진하기 위해 최적화되었습니다.
신화통신에 따르면 WAIC 2026 및 글로벌 AI 관리 고위급 회의에서 많은 기업들이 AI 에이전트(AI Agent)가 운영 비용을 크게 증가시키면서 토큰 처리 비용 절감이 핵심이 되고 있다고 밝혔습니다.
AI 칩 분야에서 텐서 프로세서(TPU)는 대규모 AI 훈련 및 추론 작업에서 그래픽 프로세서(GPU)보다 토큰당 에너지 효율성과 비용이 훨씬 우수한 것으로 평가됩니다.
TPU 칩 회사 Zhonghao Xinying의 창립자인 Yang Gongyifan은 기업의 목표가 차세대 칩에서 토큰당 비용을 절반으로 줄이고 AI 상용화를 촉진하기 위해 후세대에서 계속 줄이는 것이라고 말했습니다.
컴퓨팅 인프라에서 중국 과학 아카데미(CAS) 이사회 의장인 류하이펑은 전기 비용이 컴퓨팅 센터의 총 수명 주기 비용의 20% 이상을 차지한다고 말했습니다. 그에 따르면 풍력 발전, 태양광 발전 및 에너지 저장을 결합하면 운영 비용을 크게 줄일 수 있습니다.
AI 모델을 개발하는 기업들은 운영 비용 절감에도 집중하고 있습니다. 텐센트 회사는 Hunyuan HY3 AI 모델이 더 큰 모델과 성능이 비슷하지만 사용 비용이 훨씬 저렴하다고 밝혔습니다. 반면 Meituan 회사는 LongCat-2.0이 캐시 메모리에 저장된 토큰에 대해 무료 메커니즘을 적용한 업계 최초의 모델이라고 밝혔습니다. 이는 AI가 미리 처리하고 유사한 요구 사항이 발생했을 때 재사용하기 위해 저장한 데이터로, 사용자가 여러 번 처리 비용을 지불할 필요가 없습니다.
AI 모델 평가 기관 SuperCLUE에 따르면, 키미 K3 모델은 2위 모델보다 18% 높은 평가 점수를 받았으며, 각 작업을 완료하는 데 드는 평균 비용은 약 16% 낮습니다. 이 결과는 새로운 AI 모델이 처리 능력을 향상시킬 뿐만 아니라 사용 비용을 점점 더 절감하고 있음을 보여줍니다.
또한 "스마트 모델 라우팅" 기술도 WAIC 2026에서 관심 주제가 되고 있습니다. PPIO 회사에 따르면 이 기술은 각 작업에 적합한 AI 모델을 선택하여 처리 효율성을 약 20% 향상시키고 토큰 비용을 50-60% 절감할 수 있습니다.