Local LLM

LLM·추론 최적화 문헌 모니터 — 2026-08-25

arXiv에서 수집한 로컬 LLM·추론 최적화 논문을 관련성 게이트로 거르고 로컬 LLM으로 구조화 요약한 2026-08-25 자동 피드입니다 (채택 36편 · 신규 16편). LLM 요약은 미검증 참고용이며, 인용 전 원문 확인이 필요합니다.

·149 min read
#문헌모니터#local LLM#arXiv#추론최적화#양자화#MoE#자동화

arXiv 후보 62편 → BGE 관련성 게이트 → 채택 36편 (🆕 신규 16) · 로컬 qwen×8 구조화 요약 + 초록 한글 번역 · 사람 입력 0 · 가설발굴은 SEED→H1 엔진으로 분리

⚠️ 이 피드는 미검증 트리아지용입니다. 결정론 레이어(수집·관련성·집계·플래그·요약↔원문 정합성)는 신뢰 가능하나, LLM 요약·소견은 참고용입니다. 🚩/⚠️ 플래그가 붙은 카드는 사람 확인 대상이며, 실제로 인용·행동할 논문은 반드시 원문 초록을 직접 확인하세요. (매일 전수 검수 불필요 — 플래그 기반 선별 확인)

📡 오늘의 신호

  • 신규 논문: 16/36편 — 주제별: 긴 컨텍스트(4), 양자화(3), MoE(2), 투기적 디코딩(2), 모델 경량화(2), KV 캐시(2), 소비자 GPU 실행(1)
  • ℹ️ 범례: 🆕 = 이 피드 최초 등장(논문 발행일 아님) · 🔗 = 우리 RAG/프로젝트 도메인 접점
  • 🧭 관련성 게이트(축1: in-scope 여부, 임계 rel≥0.44): 후보 62 = 오프토픽 8 + 쿼터/캡컷 18 + 채택 36
  • 🏷️ 라벨 신뢰도(축2: 어느 토픽 라벨, 임계 0.5): [기타/미분류] 0편 · 멀티도메인 구제 1편(강등 대신 최상위 라벨 유지). ※rel(0.44)=관련성 통과 여부와 별개 축 — rel 통과했어도 라벨 신뢰도 미달이면 강등.
  • 🔬 공개데이터 accession: 오늘 초록에서 추출된 것 없음
  • ⚠️ 데이터품질 제한: 1편(초록 불완전 — 의심 슬롯과 분리)
  • 🔎 자동점검 플래그: 12편 / 14건 — 하이프-언어(5), ℹ️인용 2조각 — 떨어진 문장을 이어붙임, 문맥 연결 확인(4), ℹ️인용 3조각 — 떨어진 문장을 이어붙임, 문맥 연결 확인(3), ⚠️LLM 수치주장 미검증(1), 📄리뷰/perspective(1)

📄 논문 카드

판정 권위: 🔎자동점검(규칙기반) = 1차 신호 · 🔸LLM 소견 = 미검증 참고용(qwen 비결정론, verdict 아님).

상세 카드 36편(우리 도메인 접점) · 주변 관심 0편(접점 없음 → 하단 제목·rel만)

[MoE] SPICE: Speculative Prefetching with Low-Rank Expert Surrogates and Heterogeneous Orchestration for MoE Inference Acceleration 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.21240v1 · rel=0.683

핵심발견: SPICE는 신뢰도 기반 예측과 CPU-GPU 이종 오케스트레이션을 결합하여 DeepSeek-V2-Lite 및 Qwen2-57B-A14B 모델에서 최대 3.12배의 TPOT 속도 향상을 달성하며 품질 손실을 최소화했다. 📎근거(원문 인용): "SPICE achieves up to 3.12 speedup in Time Per Output Token (TPOT) with minimal quality loss" 방법·데이터: DeepSeek-V2-Lite, Qwen2-57B-A14B, diverse GPU platforms 검증필요: 신뢰도 기반 예측 실패 시 공유 전문가의 저랭크 전문가(LoRE) 근사화와 CPU 비동기 오프로딩이 실제 다양한 GPU 환경에서 일관되게 3.12배의 속도 향상을 보장하는지

📖 초록(한글 번역, 원문 전문)

Mixture-of-Experts (MoE) 모델들은 희소 활성화(sparse activation)가 모델 용량을 계산 비용과 분리시키기 때문에 대규모 언어 모델(LLMs)에서 점점 더 많이 사용되고 있다. 그러나 대형 전문가(expert) 파라미터의 공간 점유율은 종종 GPU 메모리 용량을 초과하여, 전문가 로딩을 위한 호스트-장치 간 PCIe 전송으로 인해 추론 지연 시간이 지배적으로 된다. 이러한 과제를 해결하기 위해, 본 논문은 경량 전문가 예측과 신뢰도 인식 CPU-GPU 오케스트레이션을 결합한 MoE 오프로딩을 위한 추측적 사전 페칭(speculative prefetching) 프레임워크인 SPICE를 제시한다. 한편, SPICE는 대상 MoE 아키텍처와 정렬된 경량 드래프트 모델(draft model)을 구축하여, 신뢰도 인식 적응형 룩어헤드(alignment lookahead) 알고리즘을 사용하여 높은 신뢰도의 전문가들을 사전 페칭한다. 다른 한편, 추측 예측이 실패할 경우, SPICE는 비용 인식 CPU-GPU 이종 오케스트레이션으로 전환한다: 낮은 신뢰도의 실패는 낮은 랭크 전문가(Low Rank Expert, LoRE) 대리 모델을 통해 잔류 공유 전문가(resident shared expert)로 근사되며, 정확한 잔여 작업(exact residual work)은 CPU로 오프로딩되어 진행 중인 GPU 연산과 병렬로 비동기적으로 실행된다. 다양한 GPU 플랫폼에서 DeepSeek-V2-Lite와 Qwen2-57B-A14B에 대해 평가한 결과, SPICE는 최소한의 품질 손실로 출력 토큰당 시간(Time Per Output Token, TPOT)에서 최대 3.12배의 속도 향상을 달성하며, 효과적인 MoE 오프로딩은 미래 전문가를 예측하는 것뿐만 아니라, 어떤 실패가 근사를 deserving하는지, 어떤 것이 정확한 복구를 필요로 하는지, 그리고 정확한 잔여 작업이 어디에서 실행되어야 하는지를 결정하는 것을 필요로 함을 보여준다.

[양자화] Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.20953v1 · rel=0.641

핵심발견: 구조적 압축된 60B 모델에 대해 원래 120B 모델로부터 직접 증류하는 양자화 인식 치유(QAH) 기법은 QAT 대비 학습 속도를 7배 빠르게 하고, 가중치 메모리를 4분의 1로 줄이면서 9개 벤치마크 중 7개에서 원본 bfloat16 모델과 동등하거나 우월한 성능을 달성한다. 📎근거(원문 인용): "On a GPT-OSS 120B to 60B to MXFP4 pipeline, the QAH student matches or beats its bfloat16 source on 7 of 9 benchmarks at roughly 4 times less weight memory and half the teacher's parameter count... Against a matched QAT baseline it reaches a comparable peak about 7 times faster" 방법·데이터: GPT-OSS 120B, MXFP4, Hypernova-60B, 9개 벤치마크 검증필요: QAH가 QAT 대비 7배 빠른 수렴 속도와 안정성을 보이는 주된 원인(손실 함수, 최적화 전략 등)에 대한 상세한 분석 부재

🔎 자동점검(규칙기반·1차 신호): ℹ️인용 2조각 — 떨어진 문장을 이어붙임, 문맥 연결 확인

📖 초록(한글 번역, 원문 전문)

거대 언어 모델을 저렴하게 제공하는 것은 점점 더 파라미터의 일부로 구조적으로 압축되고 4비트로 양자화된 모델을 배포하는 것을 의미한다. 이러한 단계들은 함께 배포 전에 회복 또는 치유 단계를 필요로 할 정도로 추론, 수학, 코딩 및 긴 문맥 행동 능력을 저하시킨다. 기본 레시피인 양자화 인식 훈련(QAT)은 압축되고 양자화된 모델을 하드 레이블에 다시 적합시킨다. 우리의 파이프라인에서 이는 느리게 수렴하며 피크를 지난 후 붕괴되었다. 우리는 대신 양자화 인식 치유(QAH)를 채택했다. 구조적으로 압축된 모델은 완전 정밀도로 독립적으로 훈련되지 않기 때문에, 그 bfloat16 체크포인트는 원본의 증류-회복 근사치이다. QAH는 4비트 학생 모델을 원본, 비압축 모델에서 직접 증류한다. GPT-OSS 120B에서 60B로 MXFP4 파이프라인에서, QAH 학생 모델은 약 4배 적은 가중치 메모리와 교사의 절반 파라미터 수로 9개 벤치마크 중 7개에서 bfloat16 소스와 동등하거나 더 나은 성능을 보였으며, Hypernova-60B로 오픈 가중치로 출시되었다. 일치하는 QAT 기준선과 비교했을 때, 이는 약 7배 더 빠르게 유사한 피크에 도달하며, 손으로 조정된 조기 종료가 필요 없이 계속된 훈련 동안 안정성을 유지한다. 또한 분산 훈련 백엔드 간에 크고 재현 가능한 품질 격차를 포함하는 배포 교훈도 보고한다. 우리의 목표는 여러 주에 걸친 하이퍼파라미터 검색 없이 배포 가능한 레시피를 제공하는 것이다.

[투기적 디코딩] LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding 🆕

2026-08-20 · arXiv · http://arxiv.org/abs/2608.20530v1 · rel=0.62

핵심발견: LiLiCorr는 DFlash 드래프터의 수용 길이를 919% 향상시키며, 72가지 설정 중 70가지에서 최고 처리량(throughput)을 달성한다. 📎근거(원문 인용): "LiLiCorr raises acceptance length on every benchmark by 9 to 19%... LiLiCorr delivers the highest throughput in 70 of 72 settings" 방법·데이터: DFlash 드래프터, 9개 벤치마크, 2개 타겟 모델 크기, 6개 동시성, 2개 입력 길이, 3개 엔트로피 계층, 공통 서빙 스택 검증필요: LiLiCorr가 '모든 벤치마크'에서 수용 길이를 919% 향상시켰다는 주장의 실제 재현 가능성 🔸LLM 확인 필요(미검증·참고용): 초록에 '모든 벤치마크에서 9~19% 향상'과 '72가지 설정 중 70가지에서 최고 처리량'이라는 두 가지 포괄적인 성능 주장이 동시에 제시되나, 구체적인 벤치마크 이름이나 통계적 유의성 검증 방법, 그리고 2가지 설정에서 최적이 아니었던 이유에 대한 설명이 없어 과장된 일반화의 가능성이 있음

🔎 자동점검(규칙기반·1차 신호): ℹ️인용 2조각 — 떨어진 문장을 이어붙임, 문맥 연결 확인

📖 초록(한글 번역, 원문 전문)

추측적 디코딩은 타겟 모델이 병렬로 검증하는 미래 토큰을 초안 작성함으로써 언어 모델 추론을 가속화한다. DFlash와 같은 확산 스타일 블록 헤드는 한 번의 순전파로 미래 토큰의 전체 블록을 예측하는 매력적인 초안 작성기이다. 그러나 이는 결합 블록 분포가 아닌 위치별 주변 분포로 학습되었으므로, 그 토큰들은 개별적으로는 타당하지만 결합적으로는 일관성이 없다. 우리는 LiLiCorr를 소개하는데, 이는 초안 작성기가 이미 생성하는 위치별 주변 분포를 상관관계 있게 만드는 경량 가능성 기반 모델이다. LiLiCorr는 각 위치에서 상위 k개 토큰을 후보로 유지하고 이를 함께 처리하여 각 토큰에 대해 내벡터와 외벡터를 생성한다. 인접한 후보 쌍은 이전 후보의 외벡터가 이후 후보의 내벡터와 높은 코사인 유사도를 가질 때 일치한다. 이러한 일치들은 전체 결합 분포를 구체화하지 않고도 블록의 결합 구조를 포착한다. 하나의 경량 네트워크 순전파가 모든 벡터를 생성하고, 쌍별 점수는 배치된 행렬 연산으로 병렬로 계산되며, 유일한 순차적 단계는 저렴한 탐욕적 걷기만 남는다. 우리는 또한 초안 작성기를 LiLiCorr와 공동 학습시켜, 더 긴 수락된 시퀀스로 상관관계 있는 후보를 제안하도록 학습시킨다. 기본 DFlash 초안 작성기에 비해 LiLiCorr는 모든 벤치마크에서 수락 길이를 9%에서 19%까지 향상시키며, 그 점수 헤드는 블록별 지연 시간의 약 2.8%를 차지한다. 초안 작성 시 일관성을 복원하는 DFlash 및 두 개의 동시 방법과 비교할 때, LiLiCorr는 72가지 설정 중 70가지에서 가장 높은 처리량을 제공한다: 탐욕적 디코딩과 온도 1 디코딩 하에서 두 가지 타겟 크기의 아홉 벤치마크, 그리고 여섯 가지 동시성, 두 가지 입력 길이, 세 가지 엔트로피 계층에 대한 처리량 스윕에서, 모든 시스템은 공통 서빙 스택에서 동일하게 최적화되었다. LiLiCorr를 학습 시켰을 때보다 한 차수 더 긴 입력으로 확장해도 그 우위를 유지한다.

[모델 경량화] Thermo-FL: Thermal-Aware Robust Federated Fine-Tuning of Large Language Models for Edge AI 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.21172v1 · rel=0.606

핵심발견: Thermo-FL은 장치 온도를 제어 신호로 활용하여 LoRA 작업량을 조절하고, TERRA를 통해 희소 업데이트를 강건하게 집계하여 적대적 환경에서도 BoolQ 정확도를 최적화하고 물리적 테스트베드에서 온도 안정화 및 통신 효율을 달성한다. 📎근거(원문 인용): "In the emulator, Thermo-FL improves robustness under adversarial sparse aggregation and achieves the strongest BoolQ accuracy across clean and attack settings... In the physical prototype, Thermo-FL stabilizes device temperature, reduces compressed upload size through bitmap sparse encoding, and preserves GSM8K utility under sign-flip/scale and MITM perturbations." 방법·데이터: 오믹스 미기재. 코호트: 대규모 에뮬레이터 및 Jetson 기반 물리적 테스트베드. 공개데이터셋명: BoolQ, GSM8K. 검증필요: 에뮬레이터와 물리적 테스트베드 간 성능 지표(BoolQ, GSM8K)의 일관성 및 실제 에지 디바이스에서의 열 제어 알고리즘이 학습 수렴에 미치는 장기적 영향 검증

🔎 자동점검(규칙기반·1차 신호): ℹ️인용 2조각 — 떨어진 문장을 이어붙임, 문맥 연결 확인

📖 초록(한글 번역, 원문 전문)

연결형 미세 조정은 사적 데이터를 중앙 집중화하지 않고 에지 장치에서 대규모 언어 모델을 적응시킬 수 있지만, 실제 배포는 하드웨어 불안정성과 적대적 업데이트 부패를 함께 해결해야 한다. 열 제한이 있는 클라이언트는 스로틀링, 로컬 학습 지연 또는 동기식 집계 지연을 일으킬 수 있는 반면, 비잔틴 클라이언트와 통신 계층의 적대자는 전역 모델을 형성하는 데 사용되는 업데이트를 부패시킬 수 있다. 이러한 과제를 해결하기 위해 우리는 로컬 어댑터 훈련과 희소 업데이트 전송을 위해 장치 온도를 능동 제어 신호로 사용하는 열 인식형 연결형 LoRA 미세 조정 프레임워크인 Thermo-FL을 제시한다. 클라이언트 측에서 Thermo-FL은 장치가 가열되거나 냉각됨에 따라 활성 LoRA 레이어 비율과 전송된 업데이트 밀도를 조정하여 열 스트레스 하에서 작업량을 줄인다. 서버 측에서 Thermo-FL은 NORM 필터링, 마스크 인식 방향 검증, 적응형 활성 좌표 클리핑 및 마스크 인식 집계를 결합하여 동적으로 희소한 LoRA 업데이트를 위한 견고한 집계 파이프라인인 TERRA를 도입한다. 우리는 대규모 에뮬레이터와 Jetson 기반 물리 테스트베드를 사용하여 Thermo-FL을 평가한다. 에뮬레이터에서 Thermo-FL은 적대적 희소 집계 하에서 견고성을 개선하며, 깨끗하고 공격적인 설정 모두에서 BoolQ 정확도에서 가장 강력한 성능을 달성하고 GSM8K에서는 경쟁력 있는 상태를 유지한다. 물리 프로토타입에서 Thermo-FL은 장치 온도를 안정화하고, 비트맵 희소 인코딩을 통해 압축된 업로드 크기를 줄이며, 부호 뒤집기/스케일 및 MITM 섭동 하에서 GSM8K 유틸리티를 보존한다. 이러한 결과는 안전한 에지 LLM 적응이 하드웨어 동작, 작업량 규제, 희소 통신 및 집계 견고성을 함께 고려해야 함을 보여준다.

[양자화] Target-Aware Calibration Data Selection for Preserving Uncertainty in Quantized Language Models 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.21019v1 · rel=0.587

핵심발견: DPQ는 배포 대상에 따라 최적의 교정 데이터 선택 전략이 달라지며, SQuAD2의 답변 가능성 경계 보존에는 DPQ-r75가, 광범위한 객관식 QA 동작 보존에는 DPQ-r50 등 더 완화된 변형이 더 우수함을 보였다. 📎근거(원문 인용): "Across 8 language models, 9 NLP benchmarks, and 22 comparison methods, the leading fixed recipe changes with the preservation target: DPQ-r75 leads on SQuAD2 answerability-boundary preservation, while milder or single-signal variants, including DPQ-r50, confidence-only, and entropy-only, better preserve broad multiple-choice QA behavior." 방법·데이터: NLP, 8개 언어 모델, 9개 NLP 벤치마크, 공개데이터셋명 미기재 검증필요: DPQ-r75가 SQuAD2의 답변 가능성 경계 보존에서 DPQ-r50 등 다른 변형보다 우월하다는 주장을 재분석으로 확인해야 함

📖 초록(한글 번역, 원문 전문)

양자화는 대규모 언어 모델을 배포하는 데 널리 사용되지만, 신뢰도, 마진, 거부 등 불확실성 행동에 미치는 영향은 주로 주요 목표로 다루어지지 않는다. 우리는 양자화를 위한 교정 데이터 선택을 대상 의존적 불확실성 보존 문제로 규정한다. 다양한 배포는 입력 분포의 서로 다른 영역을 강조하지만, 기존 연구는 주로 정확도 지향 압축 지표를 최적화하거나 양자화 후 점수를 조정한다. 우리는 분포 및 경계 보존 위험을 통해 이 목표를 공식화하고, 단일 교정 레시피가 모든 대상에 적합할 것으로 기대할 수 없는 이유를 설명하는 간단한 혼합 불일치 논증을 제공한다. 우리는 Doubt-Preserving Quantization(DPQ)를 소개하는데, 이는 경량 사전 양자화 레시피 계열로, 고정밀 예측을 사용하여 높은 의심 예와 일반 앵커의 대상 정렬 교정 혼합체를 구성한다. 8개 언어 모델, 9개 NLP 벤치마크, 22개 비교 방법 전반에 걸쳐, 주요 고정식 레시피는 보존 대상에 따라 변화한다: DPQ-r75은 SQuAD2 답변 가능성 경계 보존에서 선도적이며, DPQ-r50, 신뢰도 전용, 엔트로피 전용을 포함한 더 온화하거나 단일 신호 변형은 광범위한 객관식 QA 행동을 더 잘 보존한다. 이러한 결과는 교정 데이터가 고정된 양자화 세부사항으로 취급되기보다는 배포가 보존해야 하는 특정 고정밀 점수 행동에 따라 선택되어야 함을 보여준다.

[KV 캐시] Dual-Cache Latent Space Communication between Heterogeneous Language Models 🆕

2026-08-20 · arXiv · http://arxiv.org/abs/2608.20617v1 · rel=0.584

핵심발견: XKV는 서로 다른 아키텍처의 LLM 간 KV 캐시 번역을 통해 텍스트 기반 통신보다 최대 6.8배 빠른 속도와 더 높은 정확도를 달성하며, LCF-X 대비 모든 데이터셋에서 성능을 향상시켰다. 📎근거(원문 인용): "XKV attains the highest macro score and best average rank... surpassing text communication on four of the five, while training 76% fewer parameters and translating a cache pair 10.3x faster... end to end, XKV is 26% faster than LCF-X and 6.8x faster than text communication." 방법·데이터: 45개의 데이터셋-모델 페어 설정(6개 이종 모델 및 3개 동일 모델 순서쌍, 5개 데이터셋) 검증필요: XKV가 LCF-X 대비 모든 데이터셋에서 성능을 향상시켰다는 주장과 함께, 텍스트 통신보다 4개 데이터셋에서 우수하다는 결과의 재현성 🔸LLM 확인 필요(미검증·참고용): 초록에 제시된 수치(예: 10.3x, 26%, 6.8x)는 서로 다른 비교 기준(단일 캐시 번역 시간 vs 엔드투엔드 전체 처리 시간)을 혼용하여 제시하고 있어, 성능 향상과 효율성 개선의 실제 기여도를 분리하여 평가하기 어려운 논리적 비약이 존재한다

🔎 자동점검(규칙기반·1차 신호): ℹ️인용 3조각 — 떨어진 문장을 이어붙임, 문맥 연결 확인

📖 초록(한글 번역, 원문 전문)

다중 에이전트 LLM 시스템은 작업을 모델 간에 분할하므로, 답변 생성은 종종 다른 에이전트의 컨텍스트에 있는 지식을 필요로 한다: 공유자(Sharer)는 수신자(Receiver)가 작업을 완료하는 데 필요한 정보를 인코딩하고 있다. 이들은 일반적으로 텍스트를 교환하여 통신하므로, 자기회귀 디코딩이 임계 경로(critical path)에 위치하고 교환이 수신자의 상태를 고려하지 않고 작성된 이산 메시지(discrete message)로 축소된다. 최근의 잠재 프로토콜(latent protocols)은 공유자의 키-값(KV) 캐시를 수신자의 캐시로 변환한다. C2C는 이종 모델을 지원하지만 두 모델이 동일한 입력을 읽어야 하며, LCF-X는 위치-무관 공유자 캐시 풀링(position-free sharer-cache pooling)을 통해 이러한 공유 컨텍스트 요구사항을 제거한다. 세 가지 제한사항이 여전히 존재한다: LCF-X는 공유자만 압축하며, 수신자의 모든 위치(layer-local summary)에 동일한 계층별 요약(layer-local summary)을 제공하고, 검색할 수 있는 공동 교차 계층 메모리(joint cross-layer memory)가 없으며, 일치하는 계층 수와 KV 기하학(KV geometry)을 가정한다. 우리는 이 세 가지 제한을 모두 해소하는 XKV를 소개한다. 학습된 쿼리 어텐션(learned-query attention)은 두 캐시를 모두 풀링한다. 수신자 정렬 계층 토큰(receiver-aligned layer tokens)에 대한 셀프 어텐션(self-attention)은 학습된 계층 매핑(learned layer map)을 통해 서로 다른 깊이를 조정하며, 풀링된 요약을 컴팩트한 공동 메모리(joint memory)로 혼합한다. 공유 위치 디코더(shared position decoder)는 모든 원본 수신자 캐시 위치가 수신자의 네이티브 KV 기하학(KV geometry) 내에서 자체 헤드-게이트드 잔여(head-gated residual)를 검색할 수 있게 한다. 두 모델은 모두 고정(frozen)되며, 패밀리(family), 깊이(depth), KV 헤드 수(KV-head count), 헤드 차원(head dimension), 토크나이저(tokenizer)가 다를 수 있다. 번역기(translator)만 학습된다. 45개의 데이터셋-모델 쌍 설정(6개의 이종 및 3개의 동일 모델 순서 쌍, 5개의 데이터셋)에서 XKV는 가장 높은 매크로 점수(macro score)와 최상의 평균 순위(average rank)를 달성하며, 모든 데이터셋에서 LCF-X를 개선한다(ROPES에서 정확 일치(exact-match) 4.6점 및 F1 점수 4.2점 향상). 또한 5개 중 4개 데이터셋에서 텍스트 통신(text communication)을 능가하며, 76% fewer parameters를 학습하고 캐시 쌍(cache pair) 번역 속도를 10.3배 빠르게 한다(5.8ms 대 59.9ms). 엔드 투 엔드(end to end)로 XKV는 LCF-X보다 26% 빠르고 텍스트 통신보다 6.8배 빠르다.

[소비자 GPU 실행] Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.21134v1 · rel=0.579

핵심발견: Llama 3.2 11B Vision Instruct 모델을 2.7비트 양자화 프레임워크로 압축하여 3.7GB 크기로 줄이고 8비트 활성화와 함께 표준 시각 질문 답변 작업에서 강력한 성능을 유지함 📎근거(원문 인용): "We validate our approach by compressing the Llama 3.2 11B Vision Instruct model to 3.7 GB with 8-bit activations, preserving strong performance on a set of standard visual question answering tasks." 방법·데이터: VLM(시각-언어 모델), Llama 3.2 11B Vision Instruct, Arm CPU 검증필요: 2.7비트 파라미터 포맷과 8비트 활성화 조합이 실제 리소스 제약이 있는 모바일 하드웨어에서 예측된 대로 효율적인 추론을 제공하는지

📖 초록(한글 번역, 원문 전문)

모바일 장치에서 비전-언어 모델(VLMs)을 배포하는 것은 상당한 메모리 및 계산 요구 사항으로 인해 어렵습니다. 우리는 자원 제약이 있는 하드웨어에서 효율적인 추론을 위해 VLMs를 양자화하기 위한 프레임워크를 제시합니다. 우리의 접근 방식은 모델 자체를 사용하여 학습 데이터를 생성하며 학습 설정에 대한 접근이 필요 없는 양자화 파이프라인과 Arm CPU에서 효율적인 실행을 지원하는 새로운 2.7비트/파라미터 형식을 결합합니다. 우리는 8비트 활성화로 Llama 3.2 11B Vision Instruct 모델을 3.7GB로 압축하여 표준 시각적 질문 답변 작업 세트에서 강력한 성능을 유지함으로써 우리의 접근 방식을 검증합니다.

[MoE] Fuzzy-MoE: Interpretable Regime-Conditioned Expert Routing for Non-Stationary Multivariate Time Series Forecasting 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.20761v1 · rel=0.559

핵심발견: Fuzzy-MoE는 퍼지 로직 기반 동적 Mixture-of-Experts 모델로, 공개 시계열 벤치마크 데이터셋에서 주요 예측 방법보다 정확도가 유의미하게 높았으며, 퍼지 멤버십과 규칙 활성화를 통해 라우팅의 투명성과 해석 가능성을 입증했다. 📎근거(원문 인용): Experimental results on multiple public time series benchmark datasets show that Fuzzy-MoE significantly outperforms mainstream forecasting methods in forecasting accuracy. 방법·데이터: 공개 시계열 벤치마크 데이터셋 (초록 미기재) 검증필요: '주요 예측 방법보다 정확도가 유의미하게 높았다'는 주장을 뒷받침하는 구체적인 벤치마크 데이터셋 이름과 정량적 성능 지표 확인

📖 초록(한글 번역, 원문 전문)

비정상 다변량 시계열에서 서로 다른 변수와 샘플은 종종 이질적인 잠재 동적 상태를 나타내지만, 기존 딥러닝 기반 예측 모델은 이를 통합된 엔드투엔드 매핑으로 압축하여 시간 가변 동역학을 최적화하지 못하며, 다양한 잠재 상태 하에서 어떤 예측 메커니즘이 활성화되는지에 대한 해석 가능성을 제한한다. 이러한 한계를 극복하기 위해, 우리는 시계열 예측을 잠재 시간 상태 식별과 해석 가능한 전문가 라우팅의 통합된 프레임워크로 재정의하고, 퍼지 논리 기반의 동적 Mixture-of-Experts(MoE) 모델인 Fuzzy-MoE를 제안한다. Fuzzy-MoE는 여러 병렬 전문가 매핑 네트워크와 이중 뷰 퍼지 라우터로 구성된다. 라우터는 지역적 합동 동역학과 전역 분할 통계를 결합하여 활용함으로써 잠재 시간 상태를 추론하고, 학습 가능한 가우시안 소속 함수를 통해 전문가 활성화 강도를 계산하여 명시적인 IF-THEN 규칙 기반 전문가 선택을 가능하게 한다. 이러한 세분화된 라우팅 전략은 동일한 시퀀스 내의 서로 다른 변수가 서로 다른 전문가를 활성화하도록 하여, 이질적인 시간 동역학을 효과적으로 포착하면서도 모델 해석 가능성을 향상시킨다. 여러 공개 시계열 벤치마크 데이터셋에 대한 실험 결과는 Fuzzy-MoE가 주요 예측 방법들보다 예측 정확도에서 현저히 우수함을 보여준다. 또한, 퍼지 소속도와 규칙 활성화는 해석 가능한 라우팅 진단을 제공하며, 제안된 프레임워크가 예측 성능과 메커니즘 투명성 모두에서 효과적임을 입증한다. 블랙박스 라우팅을 사용하는 전통적인 MoE 모델과 달리, Fuzzy-MoE의 라우팅은 명확하고 해석 가능한 퍼지 규칙에 기반한다. 이로 인해 전문가 선택이 투명하고 추적 가능해진다.

[투기적 디코딩] TreeWY: Speculative Verification for Gated DeltaNet Hybrids 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.20961v1 · rel=0.558

핵심발견: 트리 구조 WY 변환을 적용하여 GDN 레이어의 매 단계 상태 스냅샷을 제거하고 단일 삼각방정식 풀이로 계산함으로써, 스펜크티브 디코딩 시 재귀적 상태 메모리 및 KV 캐시 부담을 획기적으로 줄이고 HBM을 통해 처리량 증가와 TTFT 단축을 달성했다. 📎근거(원문 인용): "Using a tree-structured WY transform of the gated delta rule, we compute every draft node's output with a single triangular solve and reconstruct only the one accepted state on commit, storing a small pseudo-value matrix instead of per-node states" 방법·데이터: Gated DeltaNet(GDN) 하이브리드 아키텍처, Qwen3.5 35B 및 397B 모델 검증필요: 트리 너비(tree width) 증가가 수용률(acceptance) 향상에는 기여하나 아직 처리량(throughput) 향상으로 이어지지 않는다는 주장의 장기적 확장성 및 다양한 모델 아키텍처 일반화 가능성

🔎 자동점검(규칙기반·1차 신호): ⚠️하이프-언어(과장 소지)

📖 초록(한글 번역, 원문 전문)

현대 오픈 모델은 하이브리드이다: 대부분의 레이어는 성장하는 키-값(KV) 캐시 대신 작은 고정 크기 순환 상태를 운반하는 선형 어텐션(Gated DeltaNet, GDN) 레이어이다. 이는 일반적인 디코딩을 메모리 효율적으로 만들지만, 추측 디코딩에는 악영향을 미친다. 초안 토큰 배치의 검증을 수행하고 거절된 토큰을 롤백하기 위해, 현재의 시스템은 GDN 레이어에 대해 각 초안 위치에서 전체 순환 상태의 스냅샷을 찍으며, 이러한 스냅샷은 초안 트리의 가지 간에 공유될 수 없으므로, 폭이 넓고 수용률이 높은 트리는 메모리 비실현 가능해진다. 우리는 스냅샷을 제거한다. 게이트드 델타 규칙의 트리 구조 WY 변환을 사용하여, 모든 초안 노드의 출력을 단일 삼각 행렬 풀이로 계산하고 커밋 시 수락된 상태만 재구성하며, 노드별 상태 대신 작은 의사-값 행렬을 저장한다. 이 유도 과정은 게이트드 델타 규칙에만 의존하며, 다른 어떤 아키텍처 세부 사항에도 의존하지 않는다. 하나의 하이브리드 모델 계열(Qwen3.5 35B 및 397B) 두 규모에 대한 서빙 벤치마크에서 이는 동일한 수용 길이에서 추측 순환 상태 메모리와 KV 캐시 부하를 절감하며, freed HBM(고대역폭 메모리)을 더 높은 처리량과 메모리가 병목인 곳에서는 훨씬 낮은 첫 토큰 생성 시간(TTFT)으로 전환하고, 메모리가 병목이 아닌 곳에서는 몇 퍼센트의 비용만 발생시킨다. 트리 폭에 관해 동일한 메모리는 경제성을 구매한다: 더 넓고 수용률이 높은 초안이 가능해지지만, 아직 처리량 이점은 아니다.

[양자화] Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.20988v1 · rel=0.557

핵심발견: 초록은 자기주의 메커니즘의 정량화 안정성을 위한 Jacobian-Guided Noise Injection 전략을 제안하며, SigLIP의 Top-1 정확도 최대 +37% 향상과 언어 모델의 WikiText perplexity 최대 40% 개선을 보고한다. 📎근거(원문 인용): "Empirical analysis reveals that the proposed method gives up to +37% relative gains on Top-1 accuracy on ImageNet-1K for SigLIP and improves relative perplexity by upto 40% on WikiText for language models in low bit quantisation settings" 방법·데이터: 초록 미기재 검증필요: 제안된 Jacobian-Guided Noise Injection 기법이 실제 저비트 정량화 환경에서 보고된 정확도 및 perplexity 개선 효과를 재현할 수 있는지 여부

🔎 자동점검(규칙기반·1차 신호): ⚠️하이프-언어(과장 소지)

📖 초록(한글 번역, 원문 전문)

대규모 언어 모델(LLMs)의 양자화(Quantization)는 종종 자기 주의(Self-attention) 메커니즘의 이산화 오류(Discretization errors)에 대한 민감성으로 인해 방해받습니다. 우리는 softmax 연산자(Softmax operator)가 이상치(Outliers)와 상태 의존적 야코비안(State-dependent Jacobian)에 대한 민감성으로 인해 양자화 안정성(Quantization stability)의 병목 현상(Bottleneck)으로 작용함을 확인합니다. 우리는 이 야코비안(Jacobian)의 노름(Norm)을 억제하는 것이 양자화로 인한 성능 저하(Performance degradation)를 제한하는 데 도움이 된다는 것을 이론적으로 입증합니다. 이를 바탕으로, 우리는 사전 주의(Pre-attention) 로짓(Logits)에 제로 평균 가우시안 노이즈(Zero-mean Gaussian noise)를 주입하고, 그 분산(Variance)이 야코비안 야코비안 노름(Jacobian Frobenius norm)에서 직접 유도되는 훈련 전략인 야코비안 가이드드 노이즈 인젝션(Jacobian-Guided Noise Injection)을 제안합니다. 휴리스틱(Heuristic)에 의존하거나 야코비안(Jacobian)을 직접 패널티(Penalise)하는 기존 접근 방식과 달리, 우리의 방법은 국소 주의 민감성(Local attention sensitivity)을 기반으로 최적의 노이즈 분산(Optimal noise variance)을 식별하는 방법을 제공합니다. 우리는 이 방법을 최첨단(SOTA) LLM 아키텍처(Architectures)에서 평가하며, 이는 인기 있는 PTQ(Post-Training Quantization) 방법들보다 향상된 강건성(Robustness)을 보여줍니다. 경험적 분석(Empirical analysis)은 제안된 방법이 SigLIP에 대해 ImageNet-1K에서 Top-1 정확도(Top-1 accuracy)에 최대 +37%의 상대적 이점(Relative gains)을 제공하며, 저비트 양자화(Low bit quantisation) 설정에서 언어 모델(Language models)에 대해 WikiText에서 상대적 퍼플렉시티(Relative perplexity)를 최대 40%까지 개선함을 밝혀내어, 이 접근법(Approach)의 효능(Efficacy)을 입증합니다.

[긴 컨텍스트] BF1: A Causal Dyadic Sparse-Attention Retrofit for Efficient Long-Context Transformers 🆕

2026-08-19 · arXiv · http://arxiv.org/abs/2608.20427v1 · rel=0.554

핵심발견: BF1는 고정 블록 너비에서 O(n log n) 상호작용과 O(log n) 통신 깊이를 가지며, 32K 컨텍스트에서 10.91x의 속도 향상을 보이고, 28개 중 8개 레이어를 대체할 때 32K에서 15.3%의 시간 단축을 달성한다. 📎근거(원문 인용): "On an NVIDIA RTX PRO 6000 Blackwell GPU, an optimized BF16 implementation crosses dense attention between 2K and 4K tokens and reaches a 10.91x per-layer prefill speedup at 32K. Retrofitting eight of 28 Qwen3-0.6B attention layers lowers warm whole-model time to first token by 7.7%, 11.3%, and 15.3% at 8K, 16K, and 32K, respectively" 방법·데이터: Qwen3-0.6B, NVIDIA RTX PRO 6000 Blackwell GPU, 1,000-step, 16.384M-token adaptation protocol 검증필요: 1,000-step, 16.384M-token의 제한된 적응 프로토콜 하에서 BF1의 성능 우위가 더 긴 학습 기간이나 다양한 데이터 분포에서도 유지되는지 여부

📖 초록(한글 번역, 원문 전문)

고도로 최적화된 정확한 커널로 구현되더라도 긴 컨텍스트에서 밀도 있는 인과적 주의는 여전히 비용이 많이 든다. 우리는 작은 정확한 국소 이웃, 전역 첫 번째 블록, 그리고 로그 간격으로 배치된 역사적 블록을 결합하는 결정론적 블록 정렬 이진 희소-주의 경로인 BF1을 연구한다. 이 경로는 기존 로그 희소 및 팽창된 주의 패턴과 관련이 있으며, 우리의 기여는 정확성 게이트가 달린 사전 학습 모델 리트로핏, 일치된 토폴로지 제어 연구, 그리고 계층별 희소성을 전체 모델 지연 시간과 연결하는 시스템 특성화이다. 고정된 블록 너비에 대해, 변환된 모든 계층은 O(n log n)개의 선택된 토큰 상호작용을 사용하며 O(log n)의 그래프 통신 깊이를 가진다. NVIDIA RTX PRO 6000 Blackwell GPU에서 최적화된 BF16 구현은 2K에서 4K 토큰 사이에서 밀도 있는 주의를 넘어 32K에서 계층별 프리필 속도 향상률 10.91배에 도달한다. 28개 Qwen3-0.6B 주의 계층 중 8개를 리트로핏하면 8K, 16K, 32K에서 각각 7.7%, 11.3%, 15.3%의 전체 모델 초기 토큰까지의 시간 단축을 달성하며, 나머지 밀도 있는 계층은 전체 모델의 점근적 이차 특성을 유지한다. 일치된 1,000단계, 16.384M 토큰 적응 프로토콜 하에서 BF1은 세 가지 학습 시드 모두에서 1위를 차지한다: 평균 보고 퍼플렉시티는 일치된 정적-무작위 비국소 그래프의 1.69154, 밀도 있는 지속 학습의 1.69258, 동일 예산 국소 슬라이딩의 1.81505에 비해 1.68639이다. 시드 1234에서, 패킹된 보고 쌍 간격은 밀도 있는 지속 학습을 BF1보다 0.3169-0.4055% 높게, 정적-무작위 그래프를 BF1보다 0.2441-0.3642% 높게 배치한다. 이러한 결과는 BF1이 실제 긴 컨텍스트 시스템의 가치를 지닌 재현 가능한 희소 연산자이자 선택적 리트로핏 원시 자료임을 입증한다. 본 논문은 수치적 정확성, 선택된 상호작용 확장, 커널 성능, 부분 모델 추론, 그리고 일치된 다음 토큰 언어 모델링을 평가한다.

[모델 경량화] COEC: Calibrated Orthogonal-Equivalence Compensation for Structured Pruning of Large Language Models 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.21142v1 · rel=0.548

핵심발견: Llama-3, Llama-3.1, Qwen2.5 모델군에서 기존 보상 방법 대비 퍼플렉시티(perplexity)를 개선하고 대부분의 제로샷 정확도(zero-shot accuracy)를 향상시켰으며, 특히 높은 희소성 수준에서 더 큰 성능 향상을 보였다. 📎근거(원문 인용): "Experiments on the Llama-3, Llama-3.1, and Qwen2.5 model families across multiple structured sparsity levels show that COEC improves perplexity on every model and zero-shot accuracy in most settings over existing compensation methods, with larger gains at higher sparsity." 방법·데이터: LLM 구조화 프루닝, Llama-3, Llama-3.1, Qwen2.5 모델군 검증필요: COEC가 '기존 보상 방법' 대비 제로샷 정확도에서 '대부분의 설정'에서 우월함을 보인다는 주장의 구체적 성능 수치 및 비교 대상 방법들의 명확성 🔸LLM 확인 필요(미검증·참고용): 초록에 '대부분의 설정(most settings)'이라는 모호한 표현이 사용되었으나, 어떤 설정에서 정확도가 향상되지 않았는지 또는 성능이 저하되었는지에 대한 구체적인 정보가 누락되어 있어 실제 과학적 결함(과장표현)으로 보기에는 근거가 부족하나,

📖 초록(한글 번역, 원문 전문)

구조화된 가지치기는 가중치 열을 제거함으로써 대규모 언어 모델(LLM)의 크기와 추론 비용을 줄이지만, 이로 인해 발생하는 출력 오차는 정확도를 저하시킬 수 있다. 기존 학습 없는 보상 방법은 보존된 가중치의 출력 측에서 가법 편향(additive bias) 또는 단일 직교 회전(orthogonal rotation)을 사용한다. 이러한 보정 방법은 입력 특이 프레임(singular frame)을 변경하지 않으므로, 열 제거 후 보존된 가중치가 적응할 수 있는 범위를 제한한다. 우리는 보존된 가중치에 교대 좌측 및 우측 직교 회전(orthogonal rotations)을 적용하는 학습 없는 보상 프레임워크인 COEC(Calibrated Orthogonal-Equivalence Compensation)를 제안한다. 우측 회전(right rotation)은 축소된 스티펠 다양체(Stiefel manifold)에서 최적화되며, 특이값(singular values)은 일반화 교차검증(generalized cross-validation)을 사용하여 각 레이어에 대한 정규화 강도를 선택하기 위해 재스케일링된다. COEC는 고에너지 활성화 방향(high-energy activation directions)의 지배력을 줄이기 위해 교정 그람 행렬(Gram matrix)을 완화하고, 인접한 어텐션 투영(attention projections) 간의 기하학적 관계를 보존하는 정렬 패널티(alignment penalty)를 도입한다. 모든 구성 요소는 작은 교정 세트(calibration set)의 2차 통계를 사용하며, LLM을 통한 역전파(backpropagation)나 모델 파라미터 재학습(retraining)이 필요하지 않다. COEC는 열 가지치기 기준(column pruning criterion)과 독립적이며 여러 구조화된 가지치기 방법(structured pruning methods)에 적용할 수 있다. Llama-3, Llama-3.1 및 Qwen2.5 모델 계열에 대해 여러 구조화된 희소성 수준(structured sparsity levels)에서 수행된 실험은 기존 보상 방법 대비 COEC가 모든 모델에서 퍼플렉시티(perplexity)를 개선하고 대부분의 설정에서 제로샷 정확도(zero-shot accuracy)를 향상시키며, 더 높은 희소성에서 더 큰 개선 효과를 보인다는 것을 보여준다. 이러한 결과는 가지치기 후 보상(post-pruning compensation)이 열 제거로 인해 손실된 성능의 일부를 회복할 수 있음을 나타낸다.

[KV 캐시] Bounded-State Restoration: Decoupling Local Restore Capacity from External LLM State 🆕

2026-08-18 · arXiv · http://arxiv.org/abs/2608.17826v1 · rel=0.521

핵심발견: BSR 기법은 외부 상태 크기가 16배 이상 증가해도 로컬 L1 스테이징 메모리(RWS)를 500.75 MiB/rank로 고정시켜 최대 63.959배의 효율적 상태를 복원한다. 📎근거(원문 인용): "a clean no-resume sweep grows external state from 1.956 to 31.277 GiB/rank while measured L1 RWS remains exactly 500.75 MiB/rank at $W=32$, a 63.959x largest-state external-to-live-staging ratio." 방법·데이터: DeepSeek-V4-Flash, TP=2, DGX Spark nodes 검증필요: W=32 설정에서 외부 상태 31.277 GiB/rank에 대해 L1 RWS가 정확히 500.75 MiB/rank로 유지되는지의 실험 재현

📖 초록(한글 번역, 원문 전문)

계층적 KV-캐시 시스템은 GPU 메모리를 넘어 긴 컨텍스트 LLM 실행 상태를 보존할 수 있지만, 보존 용량이 해당 상태를 다시 실행 가능하게 만드는 데 필요한 로컬 메모리를 결정하지는 않는다. 우리는 이 두 번째 자원을 복원 작업 집합(RWS: restoration working set)으로 분리한다. 이는 복원 동안 수명이 겹치는 피크 로컬 스테이징 상태이다. 고정된 상류 LMCache 전체 계획 경로에서, 1.956, 7.823, 그리고 15.646 GiB/rank 상태에 대한 측정된 전체 재사용 지점은 각각 2, 8, 그리고 16 GiB L1 사다리에서 처음 성공하며, 성공적인 L1 피크는 1.956, 7.824, 그리고 15.648 GiB/rank이다. 우리는 완전한 발견을 로컬 거주성과 분리하는 경계 상태 복원(BSR: Bounded-State Restoration)을 도입한다. BSR은 L1에서 전체 히트를 매개변수화하지 않고도 완전한 재사용 가능 접두사를 탐색한 후, 최대 $W$ 청크의 재사용 가능 창을 통해 확인된 상태를 설치한다. 경계 보조 상태 하에서 피크 복원 용량은 $O(W)$인 반면, 총 전송 및 설치 작업은 $Θ(|S|)$이다. 재사용 가능 상태가 이질적인 할당자 그룹과 텐서 병렬 랭크를 가로지르기 때문에, BSR은 요청 수준 커밋 규칙을 사용한다. 부분 설치가 유효한 재사용 가능 접두사로 노출되지 않으며, 실패는 광고된 접두사를 무효화하고 더 낮은 유효 계층 또는 결정론적 재계산으로 폴백한다. 두 개의 DGX Spark 노드에서 TP=2로 구성된 DeepSeek-V4-Flash에서, 초기 재개 없는 순회는 외부 상태를 1.956에서 31.277 GiB/rank로 증가시키면서 측정된 L1 RWS는 $W=32$에서 정확히 500.75 MiB/rank로 유지되며, 이는 최대 상태의 외부-라이브 스테이징 비율이 63.959배임을 의미한다. 두 번째 새로운 524K 토큰 실행은 최대 상태 수락 결과를 반복한다. 평가된 계층 및 랭크 비대칭 실패는 폴백 전에 완전한 재사용 또는 제로 외부 재사용을 노출한다. 일치하는 SSD 최적화는 RWS를 변경하지 않고 512K 복원 TTFT를 43.1초에서 17.6초로 줄인다.

[긴 컨텍스트] Do Large Language Models Play Six Degrees of Separation? Measuring Topological Compression in Long-Context Manifolds 🆕

2026-08-18 · arXiv · http://arxiv.org/abs/2608.17950v2 · rel=0.515

핵심발견: 심층 LLM 잠재 공간은 소우주 네트워크로 조직되며, 추론 레이어는 6단계 분리 한계 내로 개념 거리를 압축한다. 📎근거(원문 인용): deep reasoning layers 갑작스럽게 compress massive conceptual distances into highly navigable pathways strictly bounded by the "Six Degrees of Separation" limit (=< 6 semantic hops) 방법·데이터: RAGognize 데이터셋을 사용한 RAG 기반 제로샷 환각 탐지 검증필요: 환각 생성이 소우주 네트워크 구조의 '심각한 위상적 붕괴'를 유발한다는 주장의 정량적 기준 및 재현성 🔸LLM 확인 필요(미검증·참고용): 초록에 위상적 붕괴(topological collapse)의 정량적 정의나 측정 지표가 명시되어 있지 않아, '약 3 홉'이라는 구체적 수치와 '심각한 붕괴'라는 서술 간에 객관적 검증 기준이 부재함

📖 초록(한글 번역, 원문 전문)

대규모 언어 모델(LLMs)은 긴 문맥에 걸쳐 놀라운 다중 추론 능력을 보여주지만, 이러한 먼 인지적 도약을 가능하게 하는 내부 메커니즘은 아직 잘 이해되지 않고 있다. 전통적인 attention 기반의 해석 가능성 방법은 attention sinks와 같은 라우팅 아티팩트로 인해 실제 의미적 근접성을 포착하지 못하는 경우가 많다. 본 논문에서는 attention 가중치를 우회하여 hidden state manifold의 동적 기하학을 직접 분석하며, 심층 LLM 잠재 공간이 본질적으로 Small-World 네트워크로 조직됨을 증명한다. 긴 문맥 표현의 연속적 유사성 행렬을 가중치가 없는 그래프로 희소화시킴으로써, 두 가지 서로 다른 아키텍처 간에 높은 의미적 분리성을 가진 의미적 앵커들 간의 연결성을 추적한다. 우리의 발견은 날카로운 위상적 상전이를 드러낸다: 초기 구문론적 레이어는 완전히 분열된 상태로 남아있는 반면, 심층 추론 레이어는 거대한 개념적 거리를 '6단계의 분리' 한계(<= 6 의미적 hop)에 엄격히 구속된 높은 탐색 가능성 경로로 갑자기 압축한다. 또한, 우리는 RAGognize 데이터를 사용하여 Retrieval-Augmented Generation (RAG) 내의 제로샷 환각 검출에 이 프레임워크를 적용함으로써 이 프레임워크의 실용적 효용성을 입증한다. 사실적으로 근거를 둔 생성은 소스 문맥과 구조적 무결성을 유지하는 반면(약 3 hop), 환각은 심각한 위상적 붕괴를 유발한다. 궁극적으로 이 연구는 트랜스포머가 추상적 추론을 수행하는 방식을 수학적으로 공식화하고, 사실적 신뢰도를 평가하기 위한 새로운 엄격한 기하학적 서명을 제공한다.

[긴 컨텍스트] Rethinking Expressivity and Efficiency in Test-Time Training 🆕

2026-08-21 · arXiv · http://arxiv.org/abs/2608.21308v1 · rel=0.506

핵심발견: E²-TTT는 청크 수준에서 완전 병렬화된 훈련을 유지하면서 토큰별 반복의 시간적 구조를 보존하여, 기존 방법 대비 컨텍스트 길이 외삽 시 성능을 크게 향상시키고 효율성도 확보한다. 📎근거(원문 인용): "on the standard ``Needle in a Haystack'' passkey test, it retains over 90% accuracy at $8\times$ the training context length" 방법·데이터: 공개데이터셋명 미기재 검증필요: 1.3B 파라미터 모델의 'Needle in a Haystack' 테스트에서 8배 컨텍스트 길이에서 90% 이상 정확도를 유지한다는 주장의 재현 가능성

📖 초록(한글 번역, 원문 전문)

테스트 타임 트레이닝(TTT)은 추론 중 지속적인 가중치 업데이트를 통해 긴 컨텍스트 처리를 가능하게 하지만, 현재 방법들은 토큰별 업데이트 역학의 표현력과 청크 단위 근사의 하드웨어 효율성 사이의 균형을 맞추는 데 어려움을 겪는다. 우리는 이 격차를 해소하기 위해 E$^2$-TTT(Expressive and Efficient TTT)를 제안한다. 청크 시작 가중치에서 그래디언트를 취하는 표준 근사 하에서, 우리는 토큰별 재귀의 청크 종료 시점 빠른 가중치(fast-weight)와 모멘텀(momentum) 상태를 정확히 재현하는 폐쇄형 상태 전이(closed-form state transition)를 유도한다. 이는 기존 청크 단위 방법들이 버리는 업데이트 규칙의 시간적 구조를 보존하면서 완전히 병렬화된 청크 수준의 트레이닝을 가능하게 한다. 우리는 1.3B 파라미터 규모의 모델을 처음부터 학습시켜 E$^2$-TTT를 검증한다. 언어 모델링에서 이 방법은 이전의 TTT 및 하이브리드 어텐션(hybrid attention) 기반 방법들과 동등한 성능을 보이지만, 컨텍스트 내 검색(in-context retrieval)에서는 이를 능가한다. 그 장점은 길이 외삽(length extrapolation)에서 가장 두드러지는데, 표준 'Haystack 속 바늘(Needle in a Haystack)' 패스키(passkey) 테스트에서 훈련 컨텍스트 길이의 $8$배에서도 90% 이상의 정확도를 유지한다. 한편, E$^2$-TTT는 효율적인 청크 단위 방법들의 트레이닝 처리량(training throughput)과 동등한 수준을 달성할 수 있어, 표현력과 효율성을 효과적으로 조화시킴을 입증한다. 코드는 https://github.com/zeyun-zhong/E2-TTT에서 확인할 수 있다.

[긴 컨텍스트] Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning 🆕 🔁멀티도메인구제

2026-08-21 · arXiv · http://arxiv.org/abs/2608.21265v1 · rel=0.495

핵심발견: Memory-Augmented Compression 프레임워크는 CoD 압축 시 정확도를 크게 향상시키면서도 표준 CoT 대비 1.14~1.49배의 지연 시간 단축을 달성한다. 📎근거(원문 인용): "yielding accuracy gains of 21.4, 28.0, 29.5, and 6.61 points over CoD on GSM8K, MATH, BBH, and MMLU-Sci, while achieving a 1.14--1.49$\times$ latency speedup over standard CoT." 방법·데이터: GSM8K, MATH, BBH, MMLU-Sci 검증필요: 제안된 프레임워크가 단순히 컨텍스트 길이를 증가시키는 것이 아니라 관련성 있는 추론 메모리에서 이점을 얻는다는 주장의 타당성

📖 초록(한글 번역, 원문 전문)

거대 언어 모델은 종종 복잡한 작업을 해결하기 위해 사고의 사슬(Chain-of-Thought, CoT) 추론에 의존하지만, 장황한 추론 추적은 상당한 추론 오버헤드를 초래한다. CoT 압축은 생성을 단축하지만, 공격적인 압축은 논리적 일관성을 방해하고 성능을 저하시킬 수 있다. 우리는 명시적 추론 맥락이 디코드 시간 생성의 일부를 대체한다는 관점에서 이러한 상충 관계를 \textit{맥락-생성 치환 법칙(Context-Generation Substitution Law)}으로 공식화한다. 이 원리에 기반하여, 우리는 학습 없는 프레임워크인 \textit{메모리 증강 압축(Memory-Augmented Compression)}을 제안하는데, 이는 역사적 추적에서 재사용 가능한 추론 메모리를 구축하고 이를 프리필프(side)의 비계(scaffold)로서 검색한다. 이러한 메모리는 원시 데모스트레이션을 사용하는 대신, 압축 동안 손실된 정보를 보충하기 위해 재사용 가능한 추론 패턴, 주요 제약 조건 및 핵심 연산을 요약한다. 실험 결과는 메모리가 수학 추론, 복잡한 추론 및 과학 질문 답변 작업 전반에 걸쳐 프롬프트 기반의 초안 사고의 사슬(Chain-of-Draft, CoD) 압축을 지속적으로 개선하며, GSM8K, MATH, BBH 및 MMLU-Sci에서 CoD 대비 각각 21.4, 28.0, 29.5 및 6.61 포인트의 정확도 향상을 달성하고, 표준 CoT 대비 1.14--1.49$\times$의 지연 시간 속도 향상을 달성함을 보여준다. 메모리는 또한 토큰 수준, 추론 추적 수준 및 추론 상태 압축 메커니즘과 호환 가능하다. 추가 분석은 이러한 향상이 단순히 맥락 길이를 증가시키는 것이 아니라 관련성 있는 추론 메모리에서 비롯됨을 보여준다.

[양자화] Compress and Forget: bitsandbytes Quantization Amplifies Proactive Interference in LLMs

2026-08-19 · arXiv · http://arxiv.org/abs/2608.18578v2 · rel=0.627

핵심발견: bitsandbytes 기반 INT4 양자화는 반복된 값 덮어쓰기 시 선행 간섭(PI)으로 인한 정확도 저하를 심화시키며, 이는 동일 키 침입 오류 증가와 양자화 트랜스포머 백본에서 기인한다. 📎근거(원문 인용): INT4 quantization significantly reduces accuracy under high interference in every model (e.g., from 81.0% to 68.3% for Qwen), confirmed by paired McNemar's tests ($p \le 2.6 \times 10^{-6}$) and a mixed-effects regression spanning all interference levels 방법·데이터: LLM (Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3, Phi-3.5-mini-instruct), 정밀도 (FP16, INT8, INT4/NF4 via bitsandbytes) 검증필요: INT8 양자화가 3개 모델 중 2개에서 통계적으로 유의미한 정확도 감소를 보인다는 주장의 재현

⚠️ 데이터품질: 초록이 최대 길이에서 잘렸을 수 있음(입력 불완전 — 요약 근거 제한적)

📖 초록(한글 번역, 원문 전문)

Proactive interference (PI)는 대규모 언어 모델에서 문서화된 실패 모드로서, 반복적으로 덮어쓰인 값의 검색이 이전의 덮어쓰기가 누적됨에 따라 저하되는 현상으로, 인간의 작업 기억에서 고전적인 현상을 반영한다. Post-training quantization (PTQ)는 이제 오픈 가중치 모델의 기본 배포 경로가 되었지만, 이 실패 모드에 대한 그 효과는 아직 테스트되지 않았다. 우리는 세 가지 정밀도 수준(FP16, INT8, INT4/NF4, bitsandbytes를 통해)을 세 가지 구조적으로 상이한 지시어 튜닝 모델(Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3, Phi-3.5-mini-instruct)에 걸쳐 평가했으며, 검색 과제를 고정시켰다. INT4 양자화는 모든 모델에서 높은 간섭 하에서 정확도를 현저히 감소시켰다(예: Qwen의 경우 81.0%에서 68.3%로), 이는 짝짓기 McNemar 검정($p \le 2.6 \times 10^{-6}$)과 모든 간섭 수준을 아우르는 혼합 효과 회귀로 확인되었다. 종종 안전하다고 간주되는 INT8도 세 모델 중 두 모델에서 작지만 실제인 페널티를 수반한다. 이 효과는 의미적으로 유사한(단어 유형) 방해 요소에 국한되며, 숫자 제어 조건 하에서 부호가 반전되고, INT4 하에서 동일 키 침입 오류의 증가와 기계적으로 연결되어 있다(실험의 21.5%에서 24.6%로, $p = 4.8 \times 10^{-7}$). 후속 아블레이션 연구는 이 효과가 출력 투영 레이어가 아닌 양자화된 트랜스포머 백본에서 기인함을 보여준다. 이러한 결과는 집합적 벤치마크 정확도가 대부분 영향을 받지 않는 것처럼 보일 때조차도, bitsandbytes 4-bit 양자화가 길고 업데이트 가능하며 의미적으로 밀집된 컨텍스트에 의존하는 애플리케이션에 추가적인 비용을 부과할 수 있음을 시사한다. 우리는 우리의 코드와 토크나이저 검증 어휘 구성 방법을 https://github.com/ShayanShahrabi/compress-and-forget 에서 공개한다.

[추론 시스템] When Do LLM Agents Help? Deadline-Aware Mixed-Criticality Task Scheduling at the Autonomous-Vehicle Edge

2026-08-20 · arXiv · http://arxiv.org/abs/2608.19557v1 · rel=0.61

핵심발견: 정적 환경에서 LLM 에이전트는 배치 간격과 시간우선순위 기반 휴리스틱의 효과로 인해 추가 이점을 제공하지 않으나, 안전중요도 작업의 급증이라는 비정상 상태에서는 정적 정책보다 유의미하게 우월한 성능을 보인다. 📎근거(원문 인용): Under a mid-run surge of safety-critical tasks the picture changes, and the LLM control plane gains significantly over both the static heuristic and the bandit. 방법·데이터: 초록 미기재 검증필요: LLM 제어 평면이 비정상 상태(작업 급증)에서 정적 휴리스틱 및 밴딧보다 유의미하게 우월하다는 주장의 통계적 검증 및 재현

📖 초록(한글 번역, 원문 전문)

자율주행차는 지연 민감도 인지 작업을 인근 모바일 엣지 컴퓨팅(MEC) 서버로 오프로드하며, 여기서 안전 중요 작업의 실패는 단순히 성능 저하가 아닌 안전하지 않은 상태로 간주된다. 대규모 언어 모델(LLM)은 적응형이고 설명 가능한 스케줄러로서 점차 제안되고 있으나, 그들이 언제 도움이 되는지에 대한 증거는 드물다. 우리는 이기종 MEC 서버에서 데드라인 인식 혼합 중요도 스케줄링을 연구하며, 시간 중요(TC) 작업이 최선(best-effort) 트래픽에 대해 통제된 비용으로 보호되어야 할 때, 다중 에이전트 LLM 제어 계층이 강력한 휴리스틱을 개선하는지 묻는다. 우리는 두 단계로 답한다. 먼저 휴리스틱을 구축한다: 이는 각 입실 창에서 데드라인이 가장 빠른 순서로 시간 중요 작업을 우선순위로 정렬하고, 가장 빨리 완료되는 순서로 작업을 배치하는 창 단위 계약-네트워크 경매이다. 동일한 온라인 제약 하에서 세 가지 토폴로지와 15개 기준선으로 60개의 인스턴스에서 실험한 결과, 이 휴리스틱은 TC 완료율 0.902를 달성하여 모든 기준선(Holm 보정 p < 0.001; 최고 기준선 0.838)보다 높았으며, CP-SAT 상한선의 0.87 수준이었다. 둘째, LLM 제어 평면을 추가한다. 통제된 분해 분석은 스케줄러의 이점이 두 가지 일반적 요인, 즉 배치 지평과 시간 중요 우선 순서 지정에 기인함을 보여준다. 부하가 정상 상태일 때 경매, 창 단위 LLM 정책, 온라인 적응은 추가적인 이점을 제공하지 않으며, 이 경우 휴리스틱은 이미 거의 최적에 가깝다. 그러나 안전 중요 작업의 중간 급증 상황에서는 상황이 달라지며, LLM 제어 평면은 정적 휴리스틱과 밴딧 모두보다 유의미하게 우위를 점한다. 따라서 LLM 오케스트레이션은 고정 정책이 활용할 수 없는 여지를 열어주는 비정상 상태가 발생할 때만 그 비용을 정당화한다. 우리는 제어 평면의 지연 시간과 근거를 보고하며, 모든 코드와 시드 인스턴스를 공개한다.

[추론 시스템] Multi-Agent Orchestration with the Common-Sense Reasoning Capabilities of LLMs for Autonomous Driving

2026-08-20 · arXiv · http://arxiv.org/abs/2608.20129v1 · rel=0.591

핵심발견: LLM의 상식 추론을 오케스트레이터와 반복적 보상 함수 정제에 활용하여 PPO 기반 강화학습 및 PID 제어와 결합한 하이브리드 프레임워크가 제안되었으며, CARLA 시뮬레이션에서 다양한 환경 및 교통 조건 하에서 구조화된 제어와 안전 메커니즘을 유지하면서 LLM 기반 추론의 통합 잠재력을 입증함. 📎근거(원문 인용): The results demonstrate the potential of integrating LLM-based reasoning with conventional autonomous driving methods while retaining structured control and safety mechanism. 방법·데이터: CARLA 시뮬레이터 검증필요: LLM의 상식 추론을 통한 반복적 보상 함수 정제가 실제 동적 주행 환경에서 강화학습의 성능을 어떻게 구체적으로 향상시키는지의 정량적 검증 🔸LLM 확인 필요(미검증·참고용): 초록에 LLM 사용으로 인한 지연(latency) 문제를 해결하기 위한 구체적인 기술적 메커니즘이나 지연 시간 측정 데이터가 명시되어 있지 않음

📖 초록(한글 번역, 원문 전문)

자율주행차는 다양하고 미지의 시나리오에서 작동하기 위해 견고한 지각 및 의사결정 능력이 필요하다. 강화학습 및 규칙 기반 방법은 효과적인 제어 및 안전 메커니즘을 제공할 수 있지만, 문맥적 추론이 필요한 상황에서는 성능이 저하될 수 있다. 대규모 언어 모델(LLM)은 다중 모달 정보를 이해하고 문맥적 추론을 생성하는 데 강력한 능력을 입증하였으나, 직접적인 차량 제어에 사용할 경우 지연 및 환각 위험을 초래할 수 있다. 이러한 한계를 해결하기 위해 하이브리드 프레임워크가 제안된다. 이 시스템은 PPO로 훈련된 강화학습과 PID 제어를 조정하는 오케스트레이터를 사용하며, LLM의 상식적 추론이 프레임워크 전반에 적용된다. LLM 추론은 동적 주행 환경을 위해 강화학습 보상 함수를 정제하는 데 반복적으로 사용된다. 제안된 프레임워크는 다양한 환경 및 교통 조건 하에서 높은 무작위성을 가진 CARLA 시나리오에서 평가되었다. 결과는 구조화된 제어 및 안전 메커니즘을 유지하면서 LLM 기반 추론을 기존 자율주행 방법과 통합하는 잠재력을 입증한다.

[MoE] Cacheable by Design? Training Mixture-of-Experts Routers for Locality Against the Edge Memory-Bandwidth Wall: A Pre-Registered Negative Result with a Systems Measurement Study

2026-08-18 · arXiv · http://arxiv.org/abs/2608.18261v1 · rel=0.588

핵심발견: 로컬리티 보조 손실로 MoE 라우터를 훈련하면 캐시 미스가 최대 60% 감소하지만 사전 등록된 <=1% 퍼플렉시티 기준을 통과하지 못해 품질 저하가 발생했으며, 훈련 없는 캐시 인식 재라우팅과 훈련된 로컬리티를 결합하면 <=3.4% 퍼플렉시티 증가로 약 80% 미스 감소를 달성했다. 📎근거(원문 인용): "The mechanism works (misses down up to 60%; a 99% static-pin hit rate) but every configuration fails the pre-registered <=1% perplexity gate -- miss reduction and quality are tightly coupled." 방법·데이터: Qwen3-235B, Qwen3-30B, 137M 및 340M 파라미터 MoE 모델; llama-moe-trace 도구 사용; 공개 데이터셋명 미기재 검증필요: 훈련 없는 캐시 인식 재라우팅과 훈련된 로컬리티를 결합한 접근법이 실제 엣지 환경에서 <=3.4%의 퍼플렉시티 증가로 약 80%의 캐시 미스 감소를 일관되게 달성하는지

🔎 자동점검(규칙기반·1차 신호): ⚠️하이프-언어(과장 소지)

📖 초록(한글 번역, 원문 전문)

8GB GPU 1개에서 235B 파라미터 Mixture-of-Experts (MoE) 모델을 서빙하는 것은 연산량이 아닌 메모리 대역폭에 의해 병목된다: 디코딩은 각 토큰의 활성 전문가(experts)를 그들이 위치한 계층에서 스트리밍해야 하며, 소비자용 하드웨어에서는 대부분의 전문가들이 RAM보다 훨씬 느린 SSD에 위치한다. 우리는 Qwen3-235B (Q4_K_M, 134 GB)에서 이 대역폭 장벽을 정량화한다: 측정된 디코딩 속도는 초기 상태(warm)에서 0.44 tok/s이며, 이는 토큰당 바이트 수/대역폭 모델과 일치한다. 반면, 디스크 순회(disk sweep)를 한 번으로 상쇄해야 하는 배치 스키마(batching scheme)는 배치 크기 32에서 페이지 교체 thrash로 인해 붕괴된다. 우리는 llama-moe-trace라는 제로 서저리(zero-surgery) 라우터 텔레메트리 도구를 구축하고 Qwen3-30B에서 라우팅을 측정한다: 인접 토큰 간 전문가 재사용률은 2.0배이며, 트래픽의 95%가 전문가의 52.5%를 사용한다. 또한 전문가의 13.4%에 대한 LRU 캐시는 요청의 66%를 처리한다. 우리는 캐시 가능성(cacheability)이 훈련 가능(trainable)한지 묻는다: 우리는 캐시 미스 감소와 퍼플렉시티(perplexity)에 대한 결합 기준 하에 보조 지역성(auxiliary locality) 및 도메인 라우터(domain router) 손실 함수를 사용하여 137M MoE 언어 모델의 훈련을 사전 등록(pre-register)한다. 이 메커니즘은 작동한다(미스율이 최대 60% 감소; 99%의 정적 고정(static-pin) 히트율)지만 모든 구성이 사전 등록된 <=1% 퍼플렉시티 게이트를 통과하지 못한다—미스 감소와 품질은 긴밀하게 결합되어 있다. 동시 연구인 StickyMoE는 단일 도메인 25M 미만 모델에서 거의 무료(near-free)로 동일한 손실을 보고한다. 그러나 다중 도메인 137M 모델에서는 그 세금(tax)이 실제로 존재함을 발견한다. 우리의 기여는 이 사전 등록, 더 엄격한 기준, 다중 도메인 평가 및 엣지 서빙(edge-serving) 측정이다. 340M 규모에서 세금(scale에 따라 감소하지 않음, 오히려 약간 증가)이 축소되지 않음을 보인다. 우리는 또한 훈련 없는 캐시 인식 재라우팅 스택(rerouting stacks)이 훈련된 지역성(locality)과 함께 ~80%의 미스 감소를 달성하며, 두 규모 모두에서 <=3.4%의 퍼플렉시티를 유지하여 각각 단독으로 사용하는 것보다 훨씬 저렴함을 추가로 보인다. 반면, 도메인 프리임(domain-primed) 프리페칭(prefetching)은 도움이 되지 않는다. 모든 코드, 트레이스(traces), 그리고 사전 등록 내용은 공개된다.

[KV 캐시] CacheRoute: Planned Prefix-Affinity Routing for Large-Scale LLM Serving

2026-08-20 · arXiv · http://arxiv.org/abs/2608.19677v1 · rel=0.585

핵심발견: CacheRoute는 주기적 라우팅 계획을 통해 캐시 재사용을 최적화하여, Llama-3.3-70B 모델 환경에서 기준 대비 2.3배 높은 처리량(QPS)과 93.2%의 KV-cache 히트율을 달성하였다. 📎근거(원문 인용): "On Llama-3.3-70B in fp8 across 60 H100 GPUs, CacheRoute sustains 176+/-11 QPS at a 3.5-s p99 SLO, 2.3x the strongest of five baselines. Served KV-cache hit rate rises from 64.1+/-1.3% under cache-blind balancing to 93.2+/-0.5%." 방법·데이터: Llama-3.3-70B (fp8), 60 H100 GPU, 5개 baseline 비교, 2개 semi-synthetic aggregate, 8B 모델 실험, 2개 32B 워크로드 검증필요: 캐시 히트율 향상이 실제 다양한 워크로드에서도 일관되게 유지되며, 특히 affinity가 KV 작업을 충분히 복구하지 못할 때의 residual load skew가 성능에 미치는 영향의 정량적 한계 확인

📖 초록(한글 번역, 원문 전문)

프리픽스 캐싱은 반복 요청이 여전히 프리픽스 KV를 보유하고 있는 서버로 돌아올 때만 프리필을 회피한다. 캐시 블라인드 밸런싱은 이러한 재사용을 분산시키며, 고정 애피니티는 이를 보존하지만 서버에 과부하를 줄 수 있다. CacheRoute는 주기적인 라우팅 계획을 통해 이러한 트레이드오프를 해결한다. 이는 높은 빈도의 키를 안정적인 웜 세트에 허용하고, 예상 부하에 따라 할당 위치를 결정한다. 핫 키는 하나의 이상 목적지를 초과하여 사용할 수 있지만, 우리의 주요 반합성 집계에서 모든 키는 정확히 하나의 목적지만 사용한다. fp8 환경에서 60개의 H100 GPU를 사용한 Llama-3.3-70B 모델에서 CacheRoute는 3.5초의 p99 SLO(서비스 수준 목표) 하에서 176+/-11 QPS(초당 쿼리 수)를 유지하며, 이는 다섯 가지 베이스라인 중 가장 강력한 것보다 2.3배 빠른 속도이다. 서빙된 KV-캐시 히트율은 캐시 블라인드 밸런싱 하의 64.1+/-1.3%에서 93.2+/-0.5%로 상승한다. 두 번째 반합성 집계와 통제된 8B 및 버스트 실험은 애피니티와 배치의 효과를 분리한다. 두 개의 32B 워크로드는 반례를 제공한다: 애피니티가 너무 적은 KV 작업을 복구할 때, 잔여 부하의 편향은 개선 효과를 감소시키거나 소멸시킨다. 따라서 우리는 애피니티를 워크로드 통계만으로 활성화하기보다는 섀도우 리플레이를 통해 모든 배포를 게이트하는 것을 권장한다.

[커널·서빙] FlashAttention for Scalable Vector Architectures

2026-08-19 · arXiv · http://arxiv.org/abs/2608.18656v1 · rel=0.585

핵심발견: FlashAttention-V는 벡터 아키텍처에서 512비트 VL 기준 prefill 시 22x-42x, decode 시 8x-11x의 속도 향상을 달성했으나, Q8_0 양자화된 선형 레이어의 구조적 병목으로 인해 장기 벡터 실행 시 산술 소수화가 제한됨. 📎근거(원문 인용): "FlashAttention-V achieves 22x-42x speedup over scalar FlashAttention at 512-bit VL in prefill... During decode, FlashAttention-V achieves 8x-11x speedup using 512-bit vector lengths over scalar FlashAttention... We further identify structural bottlenecks in Q8_0 quantized linear layers that limit arithmetic amortization under long-vector execution" 방법·데이터: 벡터 아키텍처(RVV, Arm SVE), TinyLlama, Llama 3.2, Qwen2.5, Pythia-410M, gem5 시뮬레이션, Banana Pi BPI-F3 검증필요: Q8_0 양자화 형식이 RVV 및 Arm SVE 환경에서 장기 벡터 실행 시 산술 소수화를 근본적으로 제한한다는 주장의 타당성 🔸LLM 확인 필요(미검증·참고용): 초록에 특정 양자화 형식(Q8_0)이 모든 장기 벡터 환경에서 '근본적인 도전(underlying challenge)'을 제기한다고 단정하지만, 이는 특정 아키텍처(RVV, Arm SVE)와 실행 모드에 국한된 관찰일 수 있으며, 다른 양자화 방식이나 아키텍처에서는 이러한 병목이 존재하지 않을 수 있어 일반화에 주의가 필요함

🔎 자동점검(규칙기반·1차 신호): ℹ️인용 3조각 — 떨어진 문장을 이어붙임, 문맥 연결 확인

📖 초록(한글 번역, 원문 전문)

CPU에서 트랜스포머 모델 추론은 특히 Small Language Models (SLMs)의 경우 중요성이 커지고 있으며, 여기서 벡터 아키텍처는 유망한 실행 기반으로 부상하고 있다. 높은 메모리 대역폭 요구 사항으로 인해 어텐션 모듈은 주요 병목 현상이다. FlashAttention은 연산을 융합하여 데이터 국소성을 개선하고 중간 메모리 트래픽을 줄임으로써 이를 완화한다. 본 논문에서는 확장 가능한 벡터 아키텍처를 위한 블록화된 FlashAttention인 FlashAttention-V를 제시한다. 이는 어텐션 헤드 간 병렬성 활용, 헤드 차원을 초과하는 벡터 길이의 효율적 활용을 가능하게 하는 인터헤드 패킹, 그리고 벡터 레지스터 활용도 및 메모리 접근 국소성 개조를 통해 짧은 벡터에서 매우 긴 벡터까지 효율적으로 적응한다. 우리는 FlashAttention-V를 llama.cpp 내의 ggml에 통합하고, gem5와 Banana Pi BPI-F3를 사용하여 TinyLlama, Llama 3.2, Qwen2.5, Pythia-410M에서 평가했다. Banana Pi BPI-F3에서 우리는 어텐션 헤드 간 루프 재순서화 및 루프 언롤링이 효과적인 최적화 원칙임을 확인했으며, 이는 더 큰 모델과 짧은 컨텍스트 및 디코딩 단계에서 가장 두드러진 성능 향상으로 스케일링되었다. 시뮬레이션 기반 분석에 따르면, FlashAttention-V는 프리필 단계에서 512-bit VL에서 스칼라 FlashAttention 대비 22배에서 42배의 속도 향상을 달성하며, 64 레인으로 스케일링하고 4096-bit VL로 확장할 때 추가적인 2배에서 2.5배의 이점을 얻는다. 디코딩 동안 FlashAttention-V는 512-bit 벡터 길이를 사용하여 스칼라 FlashAttention 대비 8배에서 11배의 속도 향상을 달성하며, 단일 토큰 및 메모리 바운드 실행으로 인해 성능이 벡터 너비 및 레인 수에 대한 감도가 감소하는 것을 보인다. 우리는 또한 긴 벡터 실행 하에서 연산 소모를 제한하는 Q8_0 양자화된 선형 레이어의 구조적 병목 현상을 추가로 식별했으며, 이는 RVV와 Arm SVE 모두에서 일관되게 나타나, 현재 양자화 형식이 긴 벡터 확장성에 근본적인 과제를 제기함을 나타낸다.

[KV 캐시] Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

2026-08-20 · arXiv · http://arxiv.org/abs/2608.19920v1 · rel=0.58

핵심발견: 제안된 파인튜닝 방법은 임의의 KV 캐시 정책과 공적응하여 과도한 하드웨어 없이 긴 컨텍스트 추론을 가능하게 하며, 종종 정확한 어텐션으로 학습된 모델보다 성능이 우수하다. 📎근거(원문 인용): "allows the model to co-adapt with the policy, often outperforming models trained with exact attention (sequence parallelism)" 방법·데이터: 초록 미기재 검증필요: 제안된 파인튜닝 방법이 임의의 KV 캐시 정책에서 실제로 정확한 어텐션 학습 모델보다 우수한 성능을 보임

📖 초록(한글 번역, 원문 전문)

기존 연구들은 과도한 하드웨어 비용 없이 트랜스포머 언어 모델의 긴 컨텍스트 추론을 가능하게 하기 위해 희소 어텐션을 통해 키-값(KV) 캐시 선택 및 압축 문제를 다뤄왔다. 우리는 희소 어텐션으로 모델을 파인튜닝하기 위한 새로운 방법을 제시한다. 이 방법은 모든 KV 캐시 정책에서 작동하며, 적당한 하드웨어 예산(예: 40GB RAM을 갖춘 단일 Nvidia A100 GPU)으로 실행되고, 모델이 정책과 공동 적응(co-adapt)할 수 있게 하여, 종종 정확한 어텐션(exact attention)으로 학습된 모델(시퀀스 병렬화, sequence parallelism)보다 더 우수한 성능을 보인다. 또한, 우리의 실험에서 선도적인 정책인 H2O 희소 어텐션(H2O sparse attention)을 위한 효율적인 구현을 제공하며, 전용 스케일된 닷 프로덕트 어텐션 커널(scaled dot product attention kernel) 지원을 포함한다. 긴 컨텍스트 추론 및 파인튜닝을 위한 새로운 오픈 소스 라이브러리인 KeysAndValues(https://github.com/awslabs/keys_values)는 여기서 논의된 모든 방법에 대해 사용하기 쉽고 성능이 우수한 코드를 제공한다.

[커널·서빙] Flama: a Python framework for development and deployment of production-ready APIs, machine learning, and LLM services

2026-08-19 · arXiv · http://arxiv.org/abs/2608.18733v1 · rel=0.571

핵심발견: Flama는 ASGI 기반의 단일 아키텍처를 통해 REST API, 예측 모델 서빙, 생성형 AI 추론을 통합하며, Rust 가속화 코어와 다중 백엔드 LLM 서버, 자동 CRUD 생성기 등을 포함하는 생산 준비형 Python 프레임워크를 제시한다. 📎근거(원문 인용): We present Flama, an open-source Python framework for developing and deploying production-ready web APIs, machine learning services, and large-language-model (LLM) applications. Built on the Asynchronous Server Gateway Interface (ASGI), Flama offers a type-driven, async-first programming model that unifies REST API development, predictive model serving, and generative AI inference in one architecture. 방법·데이터: 초록 미기재 검증필요: Rust 가속화 코어(Maturin 컴파일)와 Python 기반의 다른 서브시스템 간 통합 시 실제 프로덕션 환경에서 기대되는 성능 향상(라우팅, JSON 인코딩 등)이 정량적으로 검증되었는지

📖 초록(한글 번역, 원문 전문)

우리는 프로덕션 준비가 된 웹 API, 머신러닝 서비스, 그리고 대규모 언어 모델(LLM) 애플리케이션을 개발하고 배포하기 위한 오픈소스 Python 프레임워크인 Flama를 제시한다. 비동기 서버 게이트웨이 인터페이스(ASGI)를 기반으로 구축된 Flama는 REST API 개발, 예측 모델 서빙, 그리고 생성형 AI 추론을 하나의 아키텍처로 통합하는 타입 기반의 비동기 우선(async-first) 프로그래밍 모델을 제공한다. Flama는 일곱 가지 하위 시스템으로 구성된다: 시작 시 타입 어노테이션에서 핸들러 파라미터를 해결하는 컴포넌트 기반 의존성 주입 시스템; 단일 어댑터 뒤에 Pydantic, Marshmallow, Typesystem을 지원하는 플러그 가능한 스키마 레이어; Repository 패턴과 Unit of Work 패턴을 기반으로 SQLAlchemy 테이블과 스키마 클래스를 REST 엔드포인트로 변환하는 자동 CRUD 생성기; scikit-learn, TensorFlow, PyTorch, Hugging Face Transformers로부터의 모델을 메타데이터와 함께 패키징하여 제로 코드 배포를 가능하게 하는 이식 가능한 바이너리 형식(.flm); 공유 코덱을 통해 네 가지 와이어 프로토콜(OpenAI, Anthropic, Ollama, 그리고 네이티브 스트리밍 다이얼렉트)을 노출하는 vLLM(Linux/CUDA) 또는 MLX(Apple Silicon)을 실행하는 멀티 백엔드 LLM 서버; 라우팅, JSON 인코딩, 압축 및 파싱을 위해 Maturin을 통해 컴파일된 Rust 가속화 핵심 모듈; 그리고 JSON-RPC 2.0을 통해 MCP 서버로 모든 애플리케이션을 변환하는 Model Context Protocol 모듈. 내장 기능에는 JWT 인증, 두 가지 페이지네이션 전략, 스레드 또는 프로세스 내의 백그라운드 작업, WebSocket 엔드포인트, Server-Sent Event 및 NDJSON 스트리밍, 핸들러 서명으로부터의 OpenAPI 3.2.0 생성, 그리고 애플리케이션 실행 및 모델 서빙, 패키징, 검사를 위한 명령줄 인터페이스가 포함된다. 우리는 아키텍처를 설명하고, 작업 예제를 통해 프로그래밍 모델을 제시하며, Flama를 기존 프레임워크, 모델 서빙 플랫폼, 그리고 LLM 추론 엔진과 비교한다.

[긴 컨텍스트] MoNe: Modular Neural Memory for Efficient Long Context Inference

2026-08-18 · arXiv · http://arxiv.org/abs/2608.17616v1 · rel=0.563

핵심발견: MoNe는 재학습 없이 고정된 Transformer에 부착되어 긴 컨텍스트 추론을 가능하게 하며, 128K 토큰에서 ICL 대비 약 80%의 컴퓨팅 및 GPU 메모리 절감 효과를 보인다. 📎근거(원문 인용): "At 128K tokens, MoNe reduces both compute and peak GPU memory by approximately 80% compared to ICL" 방법·데이터: Transformer 기반 모델, RULER 벤치마크(Needle-in-a-haystack 및 word extraction) 검증필요: 128K 토큰 환경에서 ICL 대비 80%의 컴퓨팅 및 메모리 절감 효과 재현 🔸LLM 확인 필요(미검증·참고용): 초록에 명시된 성능 저하 기준(ICL degrades sharply)에 대한 정량적 정의 부재로, '강한 성능(strong performance)'과 '급격한 저하(sharp degradation)'의 상대적 비교 기준이 모호함

📖 초록(한글 번역, 원문 전문)

우리는 MoNe를 제시한다. 이는 경량 모듈러 뉴럴 메모리(neural memory)로, 재학습 없이 긴 컨텍스트(long-context) 추론을 가능하게 하기 위해 동결된 사전 학습된 트랜스포머(Transformer)에 부착된다. MoNe는 레이어 국소화 경사 업데이트(layer-localized gradient updates)를 통해 빠른 가중치 뉴럴 메모리 네트워크(fast-weight neural memory networks)의 테스트 타임 학습(test-time learning)을 통해 고정 크기 세그먼트(fixed-size segments)로 컨텍스트(context)를 읽는다. 추론(inference) 시, 메모리(memory)는 컨텍스트 토큰(context tokens)을 다시 읽지 않고 쿼리 토큰(query tokens)만으로 키(keys)와 값(values)을 생성한다. 이러한 두 단계 설계는 추론 비용을 컨텍스트 길이와 분리하여, $N$에 따라 증가하지 않는 최대 GPU 메모리(peak GPU memory)로 $O(N)$의 전처리(preprocessing) 비용과 $O(1)$의 쿼리(query) 비용을 달성한다. 128K 토큰(tokens)에서 MoNe는 파라미터 오버헤드(parameter overhead)가 6.4%에 불과한 반면, ICL(In-Context Learning)에 비해 계산(compute)과 최대 GPU 메모리를 약 80% 감소시킨다. MoNe는 백본(backbone)의 네이티브 윈도우(native window)를 훨씬 넘어가는 컨텍스트 길이(context lengths)로 일반화되며, ICL이 급격히 성능이 저하되는 RULER의 haystack 속 바늘 찾기(needle-in-a-haystack) 및 단어 추출(word extraction) 벤치마크(benchmarks)에서 강력한 성능을 달성한다.

[추론 시스템] HYDRA: A Heterogeneous Chiplet DSE Framework for Serving Dynamic Hybrid LLM Workloads

2026-08-19 · arXiv · http://arxiv.org/abs/2608.19395v1 · rel=0.557

핵심발견: 하이브리드 LLM 서빙을 위한 이종 칩렛 시스템 설계 탐색 프레임워크 HYDRA는 아키텍처와 런타임 정책의 공동 설계를 통해 기저선 대비 평균 1.55배의 처리량 향상과 43.7%의 초기 토큰 생성 시간 단축을 달성했다. 📎근거(원문 인용): "Across all workloads, HYDRA delivers 1.55x the throughput and 43.7 percent lower time-to-first-token on average, with throughput gains reaching up to 2.3x compared to state-of-the-art baselines." 방법·데이터: 초록 미기재 검증필요: Markov 기반 성능 추정기가 다중 테넌트 런타임 역학을 포착하는 정확도와 효율성이 실제 복잡한 하이브리드 LLM 워크로드에서 일반적으로 입증되는가

📖 초록(한글 번역, 원문 전문)

하이브리드 Transformer-Mamba 대형 언어 모델(LLM)은 긴 컨텍스트 효율성을 향상시키지만, 이종 컴퓨팅 및 통신 패턴은 효율적인 하드웨어 가속화를 복잡하게 만든다. 칩렛 기반 아키텍처는 전문화된 컴퓨팅 및 메모리 유닛을 통합함으로써 확장 가능한 솔루션을 제공한다. 그러나 정적 아키텍처 구성과 동적 런타임 정책 전반에 걸친 설계 공간은 완전히 탐색하기에는 지나치게 크다. 이러한 과제를 해결하기 위해, 우리는 이종 칩렛 시스템에서 하이브리드 LLM 서빙을 위한 포괄적인 설계 공간 탐색 프레임워크인 HYDRA를 제시한다. HYDRA는 칩렛 구성, 배치, 칩렛 간 대역폭 제공, 동적 배치(dynamic batching), 런타임 스케줄링을 함께 탐색한다. 이는 통신 인식 배치, 동적 배치, 탄력적 작업 스케줄링, 그리고 효율적이고 정확한 탐색을 위해 다중 테넌트 런타임 동역학을 포착하는 빠른 마르코프 기반 성능 추정치를 통합한다. 모든 워크로드에 걸쳐 HYDRA는 최첨단 기준선과 비교하여 평균적으로 1.55배의 처리량과 43.7% 낮은 첫 번째 토큰까지의 시간을 제공하며, 처리량 향상은 최대 2.3배에 달한다. 이러한 결과는 이종 칩렛 시스템에서 효율적인 대규모 LLM 서빙을 위해 아키텍처와 런타임 정책을 공동 설계하는 것이 중요함을 강조한다.

[추론 시스템] Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

2026-08-18 · arXiv · http://arxiv.org/abs/2608.17556v1 · rel=0.546

핵심발견: Reflex-Guard는 37.6ms의 낮은 지연 시간으로 95.9%의 재현율을 달성하며 기존 방식보다 빠르고 정확하다. 📎근거(원문 인용): "we demonstrate that Reflex-Guard achieves 95.9% recall on harmful prompts at 37.6 ms end-to-end latency." 방법·데이터: 5개 출처에서 추출한 30,568개 샘플로 구성된 전략적으로 균형 잡힌 데이터셋 검증필요: DrAttack 구조화된 프롬프트의 최적 감지를 위해 임계값을 0.03으로 낮춰야 한다는 주장의 일반화 가능성 🔸LLM 확인 필요(미검증·참고용): 특정 공격 유형(DrAttack)에 대해 임계값을 0.03으로 낮춰야 한다는 점은 다른 공격 유형과의 임계값 불일치를 초래할 수 있어, 단일 모델이 다양한 공격 유형에 대해 일관된 임계값으로 높은 성능을 유지할 수 있는지에 대한 검증 필요

📖 초록(한글 번역, 원문 전문)

실제 응용 분야에서 대규모 언어 모델(Large Language Models, LLMs)은 안전 장치를 우회하도록 설계된 특별히 제작된 프롬프트의 위험에 직면하는 경우가 많습니다. LLM-as-a-judge 및 클라우드 기반 안전 API와 같은 기존 가드레일 방법은 안전하지 않은 콘텐츠를 감지할 수 있습니다. 그러나 이러한 방법은 각 요청에 대해 약 250-900 ms의 지연 시간을 추가합니다. 이 지연 시간은 시스템이 일반적으로 100 ms 미만의 응답을 필요로 하는 실시간 응용 프로그램에는 너무 높습니다. 또한 외부 검열 엔드포인트를 통해 사용자 프롬프트를 라우팅하면 상당한 데이터 프라이버시 문제가 발생합니다. 본 논문은 로컬에서 실행되는 경량 가드레일인 Reflex-Guard를 소개합니다. 이 방법은 감옥 탈출(jailbreak) 인식 전처리, 컴팩트한 문장 변환기(sentence-transformer) 임베딩 및 7개의 빠른 이진 분류기를 사용합니다. 이러한 구성 요소들은 기존 솔루션보다 훨씬 낮은 지연 시간으로 높은 정확도의 프롬프트 안전 필터링을 가능하게 합니다. 5개의 보완적인 출처에서 추출한 30,568개의 샘플로 구성된 전략적으로 균형 잡힌 데이터셋에 대한 체계적인 평가를 통해, Reflex-Guard가 37.6 ms의 엔드 투 엔드(end-to-end) 지연 시간에서 유해 프롬프트에 대해 95.9%의 재현율(recall)을 달성함을 보여줍니다. 이는 255 ms의 Llama Guard 2 및 723 ms의 SafeDecoding을 포함한 기존 베이스라인보다 빠릅니다. 기본 임계값을 사용하여 GCG 접미사 공격(GCG suffix attacks)과 Base64로 인코딩된 프롬프트의 100%를 감지할 수 있습니다. 그러나 DrAttack 구조화된 프롬프트는 고유한 확률 분포를 생성했으므로 최적의 감지를 위해 임계값을 0.03으로 낮춰야 했습니다. Reflex-Guard는 최대 16.79의 Reflex 효율성 점수(Reflex Efficiency Score, RES)를 달성하여 Llama Guard 2(11.90) 및 SafeDecoding(9.80)을 크게 능가합니다. 이 분석은 실제 배포를 위한 실용적인 조언을 제공하고, 서로 다른 공격 유형이 임베딩 확률 공간(embedding probability space)에서 서로 다른 영역을 차지함을 보여줍니다.

[모델 경량화] rEDMRec: Distilling Large Language Model Reasoning into an Editable Experience Memory for Recommendation

2026-08-19 · arXiv · http://arxiv.org/abs/2608.18952v1 · rel=0.545

핵심발견: rEDDMRec는 LLM의 추론을 편집 가능한 경험 메모리로 압축하여 경량 모델이 재사용함으로써 추천 성능을 향상시키고 온라인 추론 비용을 분리한다. 📎근거(원문 인용): "rEDMRec improves HR@1 over zero-shot, few-shot, and RAG on every backbone, and over GraphRAG on most backbones, with Impv up to 13.3% vs. the second-best baseline on ML-1M." 방법·데이터: 추천 데이터셋 (ML-1M, Amazon Beauty, Steam) 검증필요: 채널 아블레이션 결과에서 장기 선호도, 항목 인지, 반사실적 기여도가最强 학생 모델에서 성능이 역전될 수 있다는 주장의 재현 및 원인 분석 ⚠️[언어오염: 미정규화 토큰 ['强', '最']]

📖 초록(한글 번역, 원문 전문)

대규모 언어 모델은 사용자 이력과 후보 항목에 대해 명시적으로 추론함으로써 추천 품질을 향상시킬 수 있다. 예를 들어, 사용자의 선호도를 추출하거나 다른 항목보다 한 항목이 더 적합한 이유를 설명하는 방식으로, 이력을 직접 순위 목록으로 매핑하는 대신 추론을 수행한다. 그러나 이러한 추론은 모든 순위 요청마다 반복하는 데 비용이 많이 들며, 일단 생성되면 일반적으로 한 번만 소비되고 폐기되어, 향후 요청 간에 재사용되지 못하고 사용자의 취향이 변화함에 따라 검사하거나 수정하기 어렵다. 우리의 통찰은 추론이 매 호출마다 재생성될 필요가 없으며, 대신 경량 모델이 검색할 수 있는 컴팩트하고 구조화된 메모리로 한 번 압축될 수 있다면 가능하다는 것이다. 우리는 rEDMRec을 제안하며, 이는 교사 LLM의 추론을 네 가지 유형의 편집 가능한 경험 채널인 장기 선호도, 단기 컨텍스트, 항목 지각, 그리고 반사실적 하드 네거티브 비교로 압축한다. 이 채널들은 LLM 메모리 컨트롤러에 의해 유지되며, 컨트롤러는 Add/Delete/Modify/Keep 작업을 수행하고 K-에이전트 논쟁을 통해 항목을 정제한다. 경량 학생 LLM은 교사 모델을 다시 호출하지 않고 이 메모리에서 검색하여 후보를 순위 매긴다. 이를 통해 온라인 추론 비용을 추론 깊이에서 분리한다. ML-1M, Amazon Beauty, Steam 데이터셋과 열 가지 학생 백본에서 rEDMRec은 모든 백본에서 제로샷, 퓨샷, RAG 대비 HR@1을 개선하며, 대부분의 백본에서 GraphRAG 대비 HR@1을 개선한다. ML-1M에서 두 번째로 우수한 베이스라인 대비 개선율(Impv)은 최대 13.3%이다. 채널 아블레이션 분석은 단기 컨텍스트가 용량 계층 전반에 걸쳐 일관되게 도움이 되는 유일한 채널임을 보여주며, 장기, 항목 지각, 반사실적 기여는 용량에 의존적이며(가장 강력한 학생 모델에서는 역전될 수 있음)를 보여준다. 논쟁 기반 메모리 최적화는 뱅크 중복을 7.4%p 낮추면서 여섯 번의 최적화 에포크 동안 하류 HR@1을 최대 +0.029만큼 향상시킨다.

[모델 경량화] Clustering and Token Denoising for Faster and More Robust VLMs

2026-08-19 · arXiv · http://arxiv.org/abs/2608.19285v1 · rel=0.545

핵심발견: 학습 없이 시각 토큰을 97%까지 줄여 LLaVA의 처리 효율을 높이고, 극단적인 노이즈 조건에서 기존 방법 대비 최대 20% 성능 향상 및 LLaVA-OneVision에서 토큰 수를 3분의 1로 줄여도 베이스라인 성능을 달성함 📎근거(원문 인용): "Experimental results on the ScienceQA-IMG and MM-VET benchmarks show our method outperforms attention- and diversity-based methods by up to 20% under extreme noise and token conditions (reducing tokens by 97%, down to 16 tokens) on LLaVA 1.5 7b and achieves exceptional results on LLaVA-OneVision, where we match baseline performance with fewer than one-third of their tokens under mild noise conditions." 방법·데이터: VLM(LLaVA 1.5 7b, LLaVA-OneVision), ScienceQA-IMG, MM-VET 검증필요: 토큰 수를 97% 감축(16개 토큰)하는 극단적 조건에서 'attention-weighted clustering'과 'Residual Shrinkage'가 결합된 알고리즘이 실제 데이터 분포에서 어떻게 대표 토큰을 선택하고 노이즈를 제거하여 성능 저하를 방지하는지

🔎 자동점검(규칙기반·1차 신호): ⚠️하이프-언어(과장 소지)

📖 초록(한글 번역, 원문 전문)

최근 시각-언어 모델(VLMs)은 텍스트와 함께 시각 토큰을 추가함으로써 사전 훈련된 대규모 언어 모델(LLMs)의 능력을 향상시켰으며, LLaVA와 같은 접근 방식은 인상적인 결과를 보여주고 있습니다. 그러나 최대 576개 또는 729개의 시각 토큰을 처리하는 계산적 부담은 엣지 배포를 어렵게 만듭니다. 다양한 토큰 가지치기(token pruning) 기법이 재학습을 필요로 하는 반면, 일부는 학습이 필요 없으므로 아키텍처 변경에 쉽게 적응할 수 있습니다. 우리는 강건한 토큰 가지치기를 위한 두 부분으로 구성된 학습 불필요(training-free) 알고리즘인 ClustRS를 소개합니다. 첫 번째 구성 요소는 각 의미적 클러스터에서 대표 토큰을 선택하는 어텐션 가중치 기반 클러스터링 알고리즘입니다. 두 번째 구성 요소인 잔여 수축(Residual Shrinkage)은 선택된 토큰에 대한 일회성 노이즈 제거 단계입니다. 이러한 학습 불필요한 경량 단계들은 LLaVA를 실제 데이터에 적합하게 만들어 광범위한 이미지 노이즈 유형과 강도에 대한 강건성을 향상시킵니다. ScienceQA-IMG 및 MM-VET 벤치마크에서의 실험 결과는 LLaVA 1.5 7b에서 어텐션 및 다양성 기반 방법론보다 극단적인 노이즈 및 토큰 조건(토큰을 97% 줄여 16개로 감소)에서 최대 20% 더 우수한 성능을 보이며, LLaVA-OneVision에서는 약한 노이즈 조건에서 토큰을 3분의 1 미만으로 사용하면서도 베이스라인 성능과 동등한 exceptional 결과를 달성함을 보여줍니다. 본 연구는 점수 기반(score-only) 및 다양성 기반(diversity-only) 가지치기 규칙 모두에 대한 단순하지만 강력한 대안을 제시하며, 계산 효율적이고 노이즈에 강건한 VLM 배포의 길을 열었습니다.

[모델 경량화] Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress

2026-08-19 · arXiv · http://arxiv.org/abs/2608.19408v1 · rel=0.541

핵심발견: 교사 보상과 실제 추론 진전이 불일치할 경우 보상 필터링을 적용하여 추론 성능을 향상시키는 R2-OPD 방법 제안 📎근거(원문 인용): "Our approach shows consistent improvement over standard OPD especially regarding reasoning performances." 방법·데이터: 초록 미기재 검증필요: 교사 유래 보상과 독립적으로 추정된 진행 보상 간의 불일치 시 보상 억제 메커니즘이 실제 추론 진전과 일치하는지

📖 초록(한글 번역, 원문 전문)

온-폴리시 디스틸레이션(OPD)은 학생이 생성한 궤적과 교사로부터의 밀집 토큰 수준 지도를 페어링함으로써 사후 훈련 언어 모델을 위한 효과적인 프레임워크로 부상했다. 그러나 OPD는 암묵적으로 교사 유래 보상이 추론 진전의 적절한 대리 변수라고 가정하며, 따라서 정책 최적화 동안 모든 교사 피드백을 동등하게 취급한다. 그러나 실제 상황에서는 이러한 가정이 항상 성립하지 않는다. 우리는 교사 유래 보상이 실제 추론 진전과 종종 충돌함을 관찰하는데, 명확한 추론 진전을 보이는 추론 단계가 단순히 교사의 출력으로부터의 편차로 인해 더 낮은 디스틸레이션 보상을 받을 수 있기 때문이다. 이러한 불일치를 해결하기 위해, 우리는 온-폴리시 디스틸레이션을 위한 추론 진전 인식 보상 필터링(R2-OPD)을 제안하며, 이는 교사 유래 보상과 독립적으로 추정된 진전 보상이라는 두 가지 궤적 내 추론 구간의 순위를 구축한다. 두 순위가 불일치할 때 디스틸레이션 보상을 선택적으로 억제함으로써, 추론 진전과 충돌하는 지도를 줄이면서 효과적인 교사 가이드를 보존한다. 우리의 접근법은 특히 추론 성능과 관련하여 표준 OPD에 대해 일관된 개선을 보여준다.

[모델 경량화] An Empirical Study of Reward Specification and Benchmark Reliability in GRPO-based LLM Unlearning

2026-08-18 · arXiv · http://arxiv.org/abs/2608.17804v1 · rel=0.538

핵심발견: 최적화 성공은 행동적 망각과 동일하지 않으며, 보상 해킹, 정책 지원 한계, 벤치마크의 한계로 인해 서로 다른 결론을 초래할 수 있다. 📎근거(원문 인용): The experiments show that optimization success is not equivalent to behavioral unlearning: RWKU forget scores, held-out completion audits, terminal training-rollout audits, and training dynamics can point to different conclusions. 방법·데이터: 초록 미기재 검증필요: 최적화 성공이 실제 행동적 망각과 일치하지 않는다는 주장에 대한 구체적인 실험 결과 및 데이터의 재확인

📖 초록(한글 번역, 원문 전문)

실용적인 대규모 언어모델(Large Language Model, LLM)의 학습 취소(unlearning)는 일반적으로 두 가지 목표를 통해 평가된다: 대상 특정 지식(target-specific knowledge)의 억제와 비대상 유틸리티(non-target utility)의 보존이다. 생성형 질문 응답(generative QA)에서는 이 접근 방식이 세 번째 행동을 명확히 규정하지 못한다: 대상과 인접한 프롬프트(target-adjacent prompt)가 대상 특정 누설(target-specific leakage) 없이 더 넓은 범위의 답변을 허용할 때, 모델은 누설하거나, 회피하거나, 거부하는 대신 그 수준에서 답변해야 한다. 우리는 제어된 LoRA-GRPO RWKU 설정에서 이 사양 문제를 연구하며, SFT(warm-up) 유무에 관계없이 어휘 억제(lexical suppression), 거부 방지 형상화(anti-refusal shaping), 기준 기반 광범위 답변(rubric-based broad answering), 명시적 거부 대비(explicit refusal contrast)를 아우르는 네 가지 보상 설계(reward designs)를 비교한다. 실험 결과는 최적화 성공(optimization success)이 행동적 학습 취소(behavioral unlearning)와 동등하지 않음을 보여준다: RWKU 학습 취소 점수(RWKU forget scores), 홀드아웃 완료 감사(held-out completion audits), 최종 훈련 롤아웃 감사(terminal training-rollout audits), 그리고 훈련 역학(training dynamics)은 서로 다른 결론을 가리킬 수 있다. 우리는 이러한 불일치를 보상 해킹 보상점(reward-hacking endpoints), GRPO의 정책 지원 한계(policy-support limits), 보상점 변화를 놓치는 벤치마크 탐색(benchmark probes), 그리고 최적화 과정에서 낮은 의미적 누설(low semantic leakage)과 함께 광범위 주제 답변(broad-topic answering)을 선택할 수 있는 보상(rewards)으로 추적한다.

[모델 경량화] Phantom Gains: Auditing Self-Improvement Against a Measured Null

2026-08-20 · arXiv · http://arxiv.org/abs/2608.20290v1 · rel=0.535

핵심발견: 기존 자기향상 평가는 측정 오류로 인해 실제 능력 변화가 없는 모델에서도 향상된 것으로 잘못 판단할 수 있으며, 외부 지식 증류의 효과는 모델의 전반적인 성능 향상과 관련되어 있고 자기학습은 기존 문제 해결 능력을 저하시킨다. 📎근거(원문 인용): "the audit finds that external distillation improves problems the base model rarely reaches while three forms of self-training do not; a regression rejects this asymmetry as a by-product of distillation's larger overall gain ($p < 10^{-8}$)... while self-training corrupts problems solved at baseline at rates well above the measured floor." 방법·데이터: N/A (오믹스 데이터 아님) 검증필요: 자기학습(self-training)이 기저 모델에서 이미 해결 가능한 문제의 해결률을 측정 오차 한계보다 훨씬 높은 비율로 저하시킨다는 주장의 재현 🔸LLM 확인 필요(미검증·참고용): 초록에 명시된 통계적 유의성($p < 10^{-8}$)과 '측정 오차 한계보다 훨씬 높은 비율'이라는 서술 간에 정량적 불일치 가능성이 있으나, 초록의 문맥상 이는 실제 결함이라기보다 측정 방법론의 부재로 인한 과장된 인식을 지적하는 것이므로, 제시된 기준(숫자 2개 이상 인용 시 불일치)에 따라 명확한 숫자 충돌은 확인되지 않음. 그러나 'self-training corrupts problems... at rates well above the measured floor'라는 주장은 floor 값 자체의 정의와 측정 방법이 명확하지 않아 과학적 타당성 측면에서 재검증이 필요함. (단, ★지침에 따라 ''의 정의와 실제 저하율 간의 정량적 비교 근거가 초록에 부재하여 논리적 비약의 소지가 있음. 하지만 ★검수반영 지침에 따라 '논리적 비약'으로 판정하지 말라고 했으므로, 가장 적절한 것은 '-> 다시 검토

🔎 자동점검(규칙기반·1차 신호): ⚠️LLM 수치주장 미검증(규칙층 미코로보레이트 — 초록 대조 필요) · ℹ️인용 2조각 — 떨어진 문장을 이어붙임, 문맥 연결 확인

📖 초록(한글 번역, 원문 전문)

언어 모델이 자체적으로 개선되었는지는 더 이상 평균 정확도가 아닌, 개별 문제에서 어떤 능력을 획득하고 상실하는지에 따라 increasingly 판단된다. 이러한 전이를 추적한다는 것은 두 개의 잡음이 많은 추정치를 차분하는 것을 의미하며, 이는 측정 아티팩트에 취약하게 만든다. 동일한 파이프라인을 통해 고정된 통제군에 대해 Qwen3-8B에 대한 32차원 LoRA 자기 학습의 세 라운드를 감사한 결과, 보고된 발견이 통제군이 없을 때 그 결론을 뒤집는 일곱 가지 측정 실패를 확인했다. 그중 몇 가지는 표준 관행이다. 단일 탐욕적 디코딩에 기반한 장부는 추론 배치의 주요 아티팩트인 훈련되지 않은 모델에서 능력 변화를 제조하며, 획득과 선명화를 구분하는 확장 통계치는 동일한 모델에 $0.280$의 비율을 할당한다. 자연스러운 임계값 수리는 복제 과정에서 지속되지 않는다: 고정된 비교들에서 이미 포함된 이러한 설계에 걸쳐 추정될 때, 그 영가설은 영이 아닌 상태로 남는다. 우리는 이를 위양성 발견률 통제 하에서 풀링된 기준선에 대한 문제별 정확 검정으로 대체하며, 이는 모든 홀드아웃 복제본에서 아무것도 탐지하지 않으며, 다중 검정 규칙, 오류율 및 풀 크기에 대해 불변이다. 스트림, 볼륨 및 평가에서 일치된 팔들의 사다리에 적용했을 때, 감사는 외부 증류가 기본 모델이 거의 도달하지 못하는 문제를 개선하는 반면, 세 가지 형태의 자기 학습은 그렇지 않음을 발견한다. 회귀 분석은 이 비대칭성을 증류의 더 큰 전체 이득의 부산물로 기각한다($p < 10^{-8}$). 기본 모델이 결코 도달하지 않는 훨씬 더 작은 문제 집합에 대해서는 증거가 결정적이지 않으며, 자기 학습은 기준선에서 해결된 문제를 측정된 하한을 훨씬 상회하는 비율로 부패시킨다. 따라서 전이 수준 감사는 보고된 모든 통계량에 대해 별도로 측정된 영가설을 필요로 한다: 이는 새로운 실험 비용이 들지 않으며, 다중 팔 연구가 이미 보유한 기준선 복제본으로 구축되지만, 대부분의 연구가 보유한 것만큼 적은 수로는 구축되지 않는다.

[모델 경량화] Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

2026-08-20 · arXiv · http://arxiv.org/abs/2608.20281v1 · rel=0.514

핵심발견: IAR 프레임워크는 도메인 QA 정확도에서 3.6%p, 일반 성능에서 12.1%p 향상되며 도메인 특화 능력과 일반 능력 간 타협을 개선한다. 📎근거(원문 인용): IAR improves over Vanilla SFT on all four reported metrics in 7 of 8 dataset-model settings, with average gains of 3.6 percentage points in domain QA accuracy and 12.1 percentage points in mean general performance across IFEval, MMLU, and MSBench. 방법·데이터: LLM, Common Corpus (CC), CCI, Llama, Phi, Qwen, SmolLM 검증필요: IAR가 도메인 내 지식 내재화 성능을 유지하면서 일반 능력을 회복하는 메커니즘의 구체적인 원인 규명

📖 초록(한글 번역, 원문 전문)

제한된 문서 컬렉션에 대한 질문에 대해 소스 문서가 추론 시 검색되지 않을 때 대규모 언어 모델은 종종 질문에 답하지 못한다. 우리는 이 설정을 문서 지식 내재화(document knowledge internalization)로 연구한다. 이는 검색 없는 질문 응답을 위해 고정된 말뭉치를 사용 가능한 매개변수 지식(parametric knowledge)으로 변환하는 것이다. 우리는 구조화된 문서 지식 주입, 질문 응답 행동 정렬, 일반 능력 회복을 분리하는 3단계 사후 학습 프레임워크인 IAR(Inject, Align, and Recover)를 제안한다. 기존 지속 사전 훈련(continued pretraining)과 달리, Inject는 소스 문서를 이어쓰기(continuation), 재작성(rewrite), 지시 조건부 재구성(instruction-conditioned reconstruction) 목표로 변환한다. Align은 이후 답변 전용 질문 응답 지시하에 주입된 모델을 적응시키고, Recover는 도메인 적응 모델을 기본 지시 모델(base instruction model)과 병합하여 일반 능력을 회복한다. Common Corpus(CC)와 CCI에서, 그리고 Llama, Phi, Qwen, SmolLM 모델 계열 전반에 걸쳐 IAR은 검색 없는 문서 내재화를 위한 도메인-주요 도메인-일반 프론티어(domain-primary domain-general frontier)를 개선한다. 주요 비교에서 IAR은 8개의 데이터셋-모델 설정 중 7개에서 보고된 모든 4가지 지표에서 Vanilla SFT를 상회하며, IFEval, MMLU, MSBench에서 도메인 질문 응답 정확도는 평균 3.6%p, 평균 일반 성능은 12.1%p 향상되었다. 확장된 CC 베이스라인은 LoRA와 FAPM이 개별 일반 지표를 승리할 수 있음을 보여주지만, 또한 선도적이거나 근접한 도메인 내재화에 도달하는 방법들 사이에서 IAR은 가장 강력한 일반 프로필 중 하나를 유지한다.

[모델 경량화] Temporal Leakage in Financial News NLP: A Multi-Architecture Audit with a Regime-Specific M&A Signal

2026-08-18 · arXiv · http://arxiv.org/abs/2608.17223v1 · rel=0.512

핵심발견: 무작위 분할은 MCC를 1.1배에서 6.5배까지 부풀렸으며, M&A 카테고리만 근시일적 평가에서 유의미한 신호를 유지했으나 이는 범용 예측자가 아닌 2024-2025년 유럽 중심의 특정 시맨틱스에 국한됨 📎근거(원문 인용): "random splits inflate MCC by $1.1\times$ to $6.5\times$ ... M&A is the only audited category with a positive locked-test signal under near-temporal chronological evaluation ... localising the headline to our 2024-2025 European-tilted M&A semantics rather than a universal predictor" 방법·데이터: 49,799개 기사 코퍼스, TF-IDF, MiniLM, FinBERT, RoBERTa-large, DeBERTa-v3-large, Llama-3, Qwen2.5 (zero/few-shot 및 LoRA) 검증필요: 10,000회 순열 검정(p < 10^-3)으로 보고된 M&A 신호의 통계적 유의성이 재현 가능한지 🔸LLM 확인 필요(미검증·참고용): 세 명의 독립적 역할 라벨러가 수렴했다'는 진술은 정량적 검증이 아닌 '힘이 제한된 정성적 수렴'으로 인정되므로, 이를 근거로 한 '신호의 국소화' 주장은 방법론적 한계가 있음

🔎 자동점검(규칙기반·1차 신호): ℹ️인용 3조각 — 떨어진 문장을 이어붙임, 문맥 연결 확인

📖 초록(한글 번역, 원문 전문)

금융 뉴스 방향 예측은 인기 있는 자연어 처리(NLP) 벤치마크가 되었으나, 보고된 성능 향상은 훈련-테스트 분할이 시간적 순서대로 이루어졌는지 무작위로 이루어졌는지, 즉 시간적 누출(temporal leakage) 여부에 크게 의존한다. 우리는 TF-IDF, MiniLM, FinBERT, 그리고 미세 조정된 RoBERTa-large / DeBERTa-v3-large를 아우르는 16가지 특징-모델 조합과, Llama-3 및 Qwen2.5 대규모 언어 모델(LLM)에 대한 별도의 제로-샷/소수-샷 및 LoRA 프로브를 포함하여 49,799편의 기사 코퍼스에서 이러한 의존성을 감사한다. 무작위 분할은 모델 용량과 특징의 풍부함에 따라 추적하여 MCC(평균 정확도 계수)를 $1.1\times$에서 $6.5\times$까지 부풀리며, 엔드투엔드 FinBERT 미세 조정은 격차를 해소하기보다는 오히려 증폭시킨다(크기 일치 비율 $1.75\times$). 사건 유형에 조건을 부여할 때, 기업인수합병(M&A)은 거의 시간적 시간 순서 평가 하에서 양의 고정 테스트 신호를 가진 유일한 감사된 범주이다(TF-IDF MCC = 훈련 전용 $0.138$, 훈련$\cup$검증 재적 fit 하에서 $0.068$; 10,000-순열 $p < 10^{-3}$). 이 신호는 FNSPID의 2009-2020년 미국 코퍼스로 이전되지 않으며, 이는 헤드라인이 보편적 예측자가 아닌 2024-2025년 유럽 편향 M&A 의미론에 국한됨을 지역화한다. 세 개의 독립적인 역할 라벨러는 인수자 태그가 달린 기사가 신호의 위치라는 데 수렴하며, 이는 가설 검증된 비대칭성이 아니라 전력 제한된 정성적 수렴이다. 시간적 분할은 자산 가격 결정에서 특성-정화(characteristics-purging)가 수행하는 역할을 금융 NLP에서 수행한다: 이는 뉴스의 예측 가능한 구식 성분을 제거하고, 작고 사건 국한적이며 어휘적으로 얕은 잔여물을 남긴다. 우리는 금융 NLP 벤치마크에 대한 누출 감사를 필수적인 공개 사항으로 옹호한다.

[소비자 GPU 실행] A Comprehensive Review of Large Language Models for Nanophotonics: From Surrogate Modeling to Autonomous Design

2026-08-18 · arXiv · http://arxiv.org/abs/2608.18279v1 · rel=0.51

핵심발견: LLM은 구조-스펙트럼 매핑을 언어 작업으로 처리하는 서러게이트 모델과 코드 생성 및 시뮬레이션 단계 조정, 폐루프 최적화를 지원하는 에이전트 시스템으로 나뉘어 나노광학 설계 워크플로우에 통합되고 있다. 📎근거(원문 인용): "organize them into two operational modes: surrogate models that treat structure-spectrum mapping as a language task, and agentic systems that have been demonstrated to generate code, orchestrate selected simulation steps, and support closed-loop optimization." 방법·데이터: 초록 미기재 검증필요: LLM 기반 에이전트 시스템이 실제 나노광학 설계에서 시뮬레이션 단계 조정을 통해 폐루프 최적화를 수행하는 데 있어 기존 방법 대비 검증된 성능 향상 수치 또는 구체적인 사례

🔎 자동점검(규칙기반·1차 신호): ⚠️하이프-언어(과장 소지) · 📄리뷰/perspective(1차연구 아님 — 근거강도 주의)

📖 초록(한글 번역, 원문 전문)

메타표면은 빛 조작에 있어 전례 없는 정밀도를 가능하게 함으로써 광자 장치의 개발을 혁신했다. 그러나 그 설계 과정은 종종 계산 비용이 많이 드는 시뮬레이션과 복잡한 고차원 설계 공간에 의해 제약된다. 딥러닝은 대리 모델로 작용하여 설계 과정을 가속화했지만, 여전히 작업별 아키텍처에 의해 제약되며 범용 추론 능력을 결여하고 있다. 본 리뷰는 대형 언어 모델(LLM)이 기존 수치 나노포토닉스 워크플로우에 의미론적 인터페이스, 코드 생성 및 도구 오케스트레이션을 어떻게 추가하고 있는지 조사한다. 우리는 먼저 고전 신경망에서 트랜스포머 기반 모델로의 발전과 나노포토닉스 설계에서의 응용을 개괄한다. 이어 나노포토닉스 분야에서의 LLM 관련 방법론의 출현을 검토하고, 이를 두 가지 운영 모드로 분류한다. 즉, 구조-스펙트럼 매핑을 언어 작업으로 간주하는 대리 모델과, 코드를 생성하고 선택된 시뮬레이션 단계를 오케스트레이션하며 폐쇄 루프 최적화를 지원하는 에이전트 시스템이다. 또한 향후 학제간 협력 기회를 식별하기 위해, 우리는 LLM이 재료 과학 및 무선 통신과 같은 연구 분야에서의 응용을 간략히 탐구한다. 본 리뷰는 물리적 지각 능력을 갖춘 차세대 멀티모달 파운데이션 모델의 미래를 조망하며 결론을 맺는다. 이러한 비전에서 인공지능은 수동적 도구에서 능동적 협력자로 진화하여 자율적 과학 발견에 참여한다.

[추론 시스템] SIGMA: Symmetry-aware, Intelligent, Geometric, Multi-objective Adaptive Control for Robust, Dependable Traffic Management

2026-08-18 · arXiv · http://arxiv.org/abs/2608.18263v1 · rel=0.5

핵심발견: SIGMA는 LLM 기반 적응형 목적 함수 조정과 회전 증강을 통해 SUMO 시뮬레이션의 콜카타 교차로에서 고정식, 활동식, DQN 컨트롤러 대비 평균 대기 시간, 긴급 차량 대기 시간, 대기열 길이를 줄이고 처리량을 향상시켰다. 📎근거(원문 인용): Evaluated in SUMO on four Kolkata-based urban intersections against fixed-time, actuated, and DQN controllers, SIGMA reduces average/emergency waiting times and queue lengths, and boosts throughput. 방법·데이터: 시뮬레이션(SUMO), Kolkata 기반 4개 도시 교차로 검증필요: LLM 실패 시 점진적 저하(graceful degradation) 및 부트스트랩 통계에 기반한 신뢰성 보장 주장의 실제 재현 가능성

📖 초록(한글 번역, 원문 전문)

교통 신호 제어는 처리량, 대기 시간의 공정성, 신호 안정성 및 긴급 차량 우선순위 간의 균형과 실시간 적응을 요구하는 복잡한 순차적 의사결정 문제이다. 기존 강화학습(Reinforcement Learning, RL) 방법은 종종 목적을 고정하고, 동적 우선순위 변화를 무시하며, 기하학적으로 유사한 교차로 간 일반화에 실패한다. 우리는 적응형 목적 조정과 방향 불변 학습을 위해 대규모 언어 모델(Large Language Model, LLM)로 강화된 RL 프레임워크인 SIGMA(Symmetry-aware, Intelligent, Geometric, Multi-objective Adaptive traffic control)를 제안한다. SIGMA는 자연어 긴급 지시를 다목적 Actor-Critic 컨트롤러의 우선순위 벡터로 변환하여 수동 보상 공학(Reward Engineering)을 피한다. 회전 증강(Rotational augmentation)은 사거리 교차로 간 이전 가능성을 향상시키며, 오프라인에서 온라인 학습(Offline-to-online learning)은 안정적인 초기화와 변화하는 교통 상황에 대한 점진적 적응을 보장한다. 우리는 긴급 서비스 수준, LLM(Large Language Model, LLM) 실패 시 점진적 성능 저하, 수요 민감도를 포함하는 신뢰성 속성을 정의하며, 부트스트랩 통계(Bootstrap statistics)를 통해 이를 검증한다. 고정 시간(Fixed-time), 작동식(Actuated), DQN(Depth-Q Network, DQN) 컨트롤러와 비교하여 콜카타 기반 4개 도시 교차로에서 SUMO를 통해 평가한 결과, SIGMA는 평균/긴급 대기 시간과 대기열 길이를 줄이고 처리량을 증가시켰다. 아블레이션 연구(Ablation studies)는 구성 요소 실패 및 기하학적 회전(Rotations)에 대한 강건성을 확인한다. 전반적으로 SIGMA는 통계적 신뢰성 보증(Statistical reliability assurance)을 갖춘 신뢰할 수 있는, 언어 기반, 다목적 교통 제어 시스템을 제공한다.


🩺 실행 진단

  • 관련성 게이트: BGE 관련성 게이트 · 후보 62 = 오프토픽 8 + 쿼터/캡컷 18 + 채택 36
  • ★캡컷 상위(관련성 통과했으나 쿼터/캡 탈락): AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Fu(rel=0.494·커널·서빙); Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI(rel=0.493·투기적 디코딩); DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distilla(rel=0.493·모델 경량화); ReWEIGH the Evidence: Calibrating Token-Level Ordinal Visual Evidence (rel=0.493·추론 시스템); Where A Small Language Model Helps in Invoice Categorisation, Understo(rel=0.489·소비자 GPU 실행)
  • 브릿지: off(이 프로필에선 미사용)
  • 라벨 강등(신뢰도<0.5): 0편 [기타/미분류]
  • 요약노드 8/8 사용 · 전 노드 정상
  • 요약 실패(무음 전멸): 0편
  • ★무음 부분실패(핵심발견 등 핵심필드 공란): 0편
  • ★개체명 불일치(핵심발견 질병명이 타필드와 충돌 — 요약 환각 의심, F-01): 0편
  • ★요약↔원문 정합성 위반(심볼 환각·수준 혼동, B게이트): 0편

관련 글