Daily Arxiv

전 세계에서 발간되는 인공지능 관련 논문을 정리하는 페이지 입니다.
본 페이지는 Google Gemini를 활용해 요약 정리하며, 비영리로 운영 됩니다.
논문에 대한 저작권은 저자 및 해당 기관에 있으며, 공유 시 출처만 명기하면 됩니다.

On the optimization dynamics of RLVR: Gradient gap and step size thresholds

Synthetic Series-Symbol Data Generation for Time Series Foundation Models

Learning Neural Exposure Fields for View Synthesis

Fewer Weights, More Problems: A Practical Attack on LLM Pruning

Can Lessons From Human Teams Be Applied to Multi-Agent Systems? The Role of Structure, Diversity, and Interaction Dynamics

Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation

GyroSwin: 5D Surrogates for Gyrokinetic Plasma Turbulence Simulations

Online Rubrics Elicitation from Pairwise Comparisons

Scalable multilingual PII annotation for responsible AI in LLMs

Untangling Component Imbalance in Hybrid Linear Attention Conversion Methods

Reinforce-Ada: An Adaptive Sampling Framework for Reinforce-Style LLM Training

Revealing Interconnections between Diseases: from Statistical Methods to Large Language Models

P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs

MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering

Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention

Spatiotemporal Forecasting as Planning: A Model-Based Reinforcement Learning Approach with Generative World Models

6G-Enabled Digital Twin Framework for Real-Time Cyber-Physical Systems: An Experimental Validation with Industrial Bearing Fault Detection

InstructPLM-mu: 1-Hour Fine-Tuning of ESM2 Beats ESM3 in Protein Mutation Predictions

Prompt-Aware Scheduling for Low-Latency LLM Serving

Learning Robust Diffusion Models from Imprecise Supervision

CLARITY: Clinical Assistant for Routing, Inference, and Triage

Nav-EE: Navigation-Guided Early Exiting for Efficient Vision-Language Models in Autonomous Driving

Machine Learning for Detection and Analysis of Novel LLM Jailbreaks

Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity

TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos

Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation

ClustRecNet: A Novel End-to-End Deep Learning Framework for Clustering Algorithm Recommendation

Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm

InfiR2: A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models

Benchmarking and Mitigate Sycophancy in Medical Vision-Language Models

CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics

A Mega-Study of Digital Twins Reveals Strengths, Weaknesses and Opportunities for Further Improvement

Robust LLM Training Infrastructure at ByteDance

RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation

MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment

Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal

Individual utilities of life satisfaction reveal inequality aversion unrelated to political alignment

COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens

From Federated Learning to X-Learning: Breaking the Barriers of Decentrality Through Random Walks

Latent Variable Modeling in Multi-Agent Reinforcement Learning via Expectation-Maximization for UAV-Based Wildlife Protection

Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations

Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices

On Task Vectors and Gradients

On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting

LATTE: Learning Aligned Transactions and Textual Embeddings for Bank Clients

ACD-CLIP: Decoupling Representation and Dynamic Fusion for Zero-Shot Anomaly Detection

Neural Beam Field for Spatial Beam RSRP Prediction

AMFT: Aligning LLM Reasoners by Meta-Learning the Optimal Imitation-Exploration Balance

Reasoning through Exploration: A Reinforcement Learning Framework for Robust Function Calling

VAGPO: Vision-augmented Asymmetric Group Preference Optimization for Graph Routing Problems

TriP-LLM: A Tri-Branch Patch-wise Large Language Model Framework for Time-Series Anomaly Detection

Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance

Preprint: Poster: Did I Just Browse A Website Written by LLMs?

Site-Level Fine-Tuning with Progressive Layer Freezing: Towards Robust Prediction of Bronchopulmonary Dysplasia from Day-1 Chest Radiographs in Extremely Preterm Infants

AirScape: An Aerial Generative World Model with Motion Controllability

Tuning without Peeking: Provable Privacy and Generalization Bounds for LLM Post-Training

EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework

Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System

Quantifying Fairness in LLMs Beyond Tokens: A Semantic and Statistical Perspective

Interpretable and Granular Video-Based Quantification of Motor Characteristics from the Finger Tapping Test in Parkinson Disease

Bures-Wasserstein Flow Matching for Graph Generation

Symmetry in Neural Network Parameter Spaces

CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

AD-EE: Early Exiting for Fast and Reliable Vision-Language Models in Autonomous Driving

Robustness in Both Domains: CLIP Needs a Robust Text Encoder

Elicit and Enhance: Advancing Multimodal Reasoning in Medical Scenarios

Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model

An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks

FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information

Beyond Demonstrations: Dynamic Vector Construction from Latent Representations

DDO: Dual-Decision Optimization for LLM-Based Medical Consultation via Multi-Agent Collaboration

Sequential Monte Carlo for Policy Optimization in Continuous POMDPs

Game of Trust: How Trustworthy Does Your Blockchain Think You Are?

Collaborative Unlabeled Data Optimization

Reasoning Large Language Model Errors Arise from Hallucinating Critical Problem Features

System Prompt Optimization with Meta-Learning

Cognitio Emergens: Agency, Dimensions, and Dynamics in Human-AI Knowledge Co-Creation

Multimodal Language Models See Better When They Look Shallower

Exploring human-SAV interaction using LLMs: The impact of psychological factors on user experience

On Developers' Self-Declaration of AI-Generated Code: An Analysis of Practices

Diffusion Generative Recommendation with Continuous Tokens

TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-to-Audio Synthesis

DeepOHeat-v1: Efficient Operator Learning for Fast and Trustworthy Thermal Simulation and Optimization in 3D-IC Design

Brain2Text Decoding Model Reveals the Neural Mechanisms of Visual Semantic Processing

Issue Localization via LLM-Driven Iterative Code Graph Searching

CCDP: Composition of Conditional Diffusion Policies with Guided Sampling

Measuring directional bias amplification in image captions using predictability

Contrastive Learning Augmented Social Recommendations

WyckoffDiff -- A Generative Diffusion Model for Crystal Symmetry

Solving Linear-Gaussian Bayesian Inverse Problems with Decoupled Diffusion Sequential Monte Carlo

RadVLM: A Multitask Conversational Vision-Language Model for Radiology

IG-MCTS: Human-in-the-Loop Cooperative Navigation under Incomplete Information

OrcaLoca: An LLM Agent Framework for Software Issue Localization

Enabling Population-Level Parallelism in Tree-Based Genetic Programming for GPU Acceleration

AD-LLM: Benchmarking Large Language Models for Anomaly Detection

Preference Discerning with LLM-Enhanced Generative Retrieval

SwarmGPT: Combining Large Language Models with Safe Motion Planning for Drone Swarm Choreography

Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training

Medchain: Bridging the Gap Between LLM Agents and Clinical Practice with Interactive Sequence

InfiR2: A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models

Created by

Haebom

저자

Wenjun Wang, Shuo Cai, Congkai Xie, Mingfa Feng, Yiming Zhang, Zhen Li, Kejing Yang, Ming Li, Jiannong Cao, Hongxia Yang

FP8 훈련 레시피 소개

개요

대규모 언어 모델(LLM) 훈련의 막대한 계산 비용은 혁신에 큰 장벽이 된다. FP8 훈련은 상당한 이론적 효율성 향상을 제공하는 유망한 솔루션이지만, 포괄적인 오픈 소스 훈련 레시피의 부재로 인해 광범위한 채택이 저해되었다. 본 논문은 지속적인 사전 훈련과 지도 미세 조정을 원활하게 통합하는 종단 간 FP8 훈련 레시피를 소개한다. 미세 입자, 하이브리드 세분성 양자화 전략을 사용하여 수치적 충실도를 유지하면서 계산 효율성을 극대화한다. 1600억 토큰 코퍼스에서 모델의 지속적인 사전 훈련을 포함한 광범위한 실험을 통해, 본 레시피는 매우 안정적일 뿐만 아니라 본질적으로 손실이 없음을 입증했다. 다양한 추론 벤치마크에서 BF16 기반선과 동등한 성능을 달성했다. 최대 22%의 훈련 시간 단축, 14%의 최대 메모리 사용량 감소, 19%의 처리량 증가를 포함하여 상당한 효율성 향상을 통해 이를 달성했다.

시사점, 한계점

•

FP8을 BF16의 실용적이고 강력한 대안으로 제시

•

훈련 시간 최대 22% 감소, 메모리 사용량 14% 감소, 처리량 19% 증가

•

오픈 소스 코드 공개 예정

•

논문에서 구체적인 한계점은 언급되지 않음

Made with Slashpage