메뉴 건너뛰기
소속 기관 / 학교 인증
인증하면 논문, 학술자료 등을  무료로 열람할 수 있어요.
한국대학교, 누리자동차, 시립도서관 등 나의 기관을 확인해보세요
(국내 대학 90% 이상 구독 중)
고객센터 ENG
주제분류

논문 기본 정보

저자정보
(연세대학교) (연세대학교) (DGIST) (연세대학교) (연세대학교)
저널정보
Korean Institute of Information Scientists and Engineers 한국정보과학회 학술발표논문집 한국정보과학회 2025 한국소프트웨어종합학술대회 논문집
오류 신고하기

피인용 0

검색

    초록·키워드

    대규모 언어 모델(LLM, Large Language Model)을 챗봇 등 실제 서비스에 효율적으로 활용하기 위해서는 적절한 시간 내로 모델이 토큰을 생성하여 서비스 수준 목표(SLO, Serive Level Objective)를 만족할뿐만 아니라 사용자에게 제공하는 답변의 품질이 일정 수준 이상이 되도록 보장해야 한다. LLM 추론(inference) 연산에 특화된 프로세서로는 NPU가 존재하는데, NPU는 신경망 연산에 특화된 대규모 병렬 처리를 통해 빠르게 토큰을 제공할 수 있다. 그러나 빠른 추론을 위해 FP8 등 낮은 정밀도를 사용하여 답변의 품질이 떨어진다. 반면, CPU는 각 토큰을 제공 ... 전체 초록 보기

    최근 본 자료 전체보기

      UCI(KEPA) : I410-151-26-02-096046494