Daily Arxiv

전 세계에서 발간되는 인공지능 관련 논문을 정리하는 페이지 입니다.
본 페이지는 Google Gemini를 활용해 요약 정리하며, 비영리로 운영 됩니다.
논문에 대한 저작권은 저자 및 해당 기관에 있으며, 공유 시 출처만 명기하면 됩니다.

Inductive Moment Matching

LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL

Ideas in Inference-time Scaling can Benefit Generative Pre-training Algorithms

FaceID-6M: A Large-Scale, Open-Source FaceID Customization Dataset

Interactive Medical Image Analysis with Concept-based Similarity Reasoning

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

LightMotion: A Light and Tuning-free Method for Simulating Camera Motion in Video Generation

A Transformer Model for Predicting Chemical Reaction Products from Generic Templates

CBW: Towards Dataset Ownership Verification for Speaker Verification via Clustering-based Backdoor Watermarking

The Lazy Student's Dream: ChatGPT Passing an Engineering Course on Its Own

VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control

Multi-Task Reinforcement Learning Enables Parameter Scaling

Balcony: A Lightweight Approach to Dynamic Inference of Generative Language Models

Prediction of Frozen Region Growth in Kidney Cryoablation Intervention Using a 3D Flow-Matching Model

Call for Rigor in Reporting Quality of Instruction Tuning Data

KunlunBaize: LLM with Multi-Scale Convolution and Multi-Token Prediction Under TransformerX Framework

(How) Do Language Models Track State?

IterPref: Focal Preference Learning for Code Generation via Iterative Debugging

PaCA: Partial Connection Adaptation for Efficient Fine-Tuning

Forgotten Polygons: Multimodal Large Language Models are Shape-Blind

Q-PETR: Quant-aware Position Embedding Transformation for Multi-View 3D Object Detection

FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling

Helix-mRNA: A Hybrid Foundation Model For Full Sequence mRNA Therapeutics

IMLE Policy: Fast and Sample Efficient Visuomotor Policy Learning via Implicit Maximum Likelihood Estimation

Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models

Equivariant Masked Position Prediction for Efficient Molecular Representation

IRepair: An Intent-Aware Approach to Repair Data-Driven Errors in Large Language Models

Automated Consistency Analysis of LLMs

ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates

Rationalization Models for Text-to-SQL

Reflection-Window Decoding: Text Generation with Selective Refinement

Agentic Bug Reproduction for Effective Automated Program Repair at Google

Data Duplication: A Novel Multi-Purpose Attack Paradigm in Machine Unlearning

MambaQuant: Quantizing the Mamba Family with Variance Aligned Rotation Methods

KAA: Kolmogorov-Arnold Attention for Enhancing Attentive Graph Neural Networks

TexAVi: Generating Stereoscopic VR Video Clips from Text Descriptions

Multi-P$^2$A: A Multi-perspective Benchmark on Privacy Assessment for Large Vision-Language Models

Faster Vision Mamba is Rebuilt in Minutes via Merged Token Re-training

SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization

DMin: Scalable Training Data Influence Estimation for Diffusion Models

MAGIC: Mastering Physical Adversarial Generation in Context through Collaborative LLM Agents

LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models

RL-MILP Solver: A Reinforcement Learning Approach for Solving Mixed-Integer Linear Programs with Graph Neural Networks

Proto Successor Measure: Representing the Behavior Space of an RL Agent

KinMo: Kinematic-aware Human Motion Understanding and Generation

Towards Million-Scale Adversarial Robustness Evaluation With Stronger Individual Attacks

OminiControl: Minimal and Universal Control for Diffusion Transformer

MTA: Multimodal Task Alignment for BEV Perception and Captioning

PyGen: A Collaborative Human-AI Approach to Python Package Creation

Fair Summarization: Bridging Quality and Diversity in Extractive Summaries

AtlasSeg: Atlas Prior Guided Dual-U-Net for Cortical Segmentation in Fetal Brain MRI

V-LoRA: An Efficient and Flexible System Boosts Vision Applications with LoRA LMM

Fourier Head: Helping Large Language Models Learn Complex Probability Distributions

Conditional diffusions for neural posterior estimation

LLM-HDR: Bridging LLM-based Perception and Self-Supervision for Unpaired LDR-to-HDR Image Reconstruction

Chemistry-Inspired Diffusion with Non-Differentiable Guidance

Taylor Unswift: Secured Weight Release for Large Language Models via Taylor Expansion

6DGS: Enhanced Direction-Aware Gaussian Splatting for Volumetric Rendering

CAX: Cellular Automata Accelerated in JAX

Emotion-Aware Embedding Fusion in LLMs (Flan-T5, LLAMA 2, DeepSeek-R1, and ChatGPT 4) for Intelligent Response Generation

What Information Contributes to Log-based Anomaly Detection? Insights from a Configurable Transformer-Based Approach

Meta-RTL: Reinforcement-Based Meta-Transfer Learning for Low-Resource Commonsense Reasoning

LEMMo-Plan: LLM-Enhanced Learning from Multi-Modal Demonstration for Planning Sequential Contact-Rich Manipulation Tasks

Training with Differential Privacy: A Gradient-Preserving Noise Reduction Approach with Provable Security

ASMA: An Adaptive Safety Margin Algorithm for Vision-Language Drone Navigation via Scene-Aware Control Barrier Functions

Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame Pruning

Inference-Time Selective Debiasing to Enhance Fairness in Text Classification Models

Detect, Investigate, Judge and Determine: A Knowledge-guided Framework for Few-shot Fake News Detection

How Data Inter-connectivity Shapes LLMs Unlearning: A Structural Unlearning Perspective

Value Improved Actor Critic Algorithms

Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided Search

Curriculum Direct Preference Optimization for Diffusion and Consistency Models

Is the House Ready For Sleeptime? Generating and Evaluating Situational Queries for Embodied Question Answering

RealmDreamer: Text-Driven 3D Scene Generation with Inpainting and Depth Diffusion

Adversarial Guided Diffusion Models for Adversarial Purification

M-HOF-Opt: Multi-Objective Hierarchical Output Feedback Optimization via Multiplier Induced Loss Landscape Scheduling

The VampPrior Mixture Model

Regularization by Texts for Latent Diffusion Inverse Solvers

Deep Tensor Network

Identifying the Truth of Global Model: A Generic Solution to Defend Against Byzantine and Backdoor Attacks in Federated Learning (full version)

Generalizable Imitation Learning Through Pre-Trained Representations

Hypergraph Structure Inference From Data Under Smoothness Prior

HowkGPT: Investigating the Detection of ChatGPT-generated University Student Homework through Context-Aware Perplexity Analysis

SketchOGD: Memory-Efficient Continual Learning

ChatGPT-4 in the Turing Test: A Critical Analysis

Toward an Evaluation Science for Generative AI Systems

WritingBench: A Comprehensive Benchmark for Generative Writing

ToolFuzz -- Automated Agent Tool Testing

Building Interval Type-2 Fuzzy Membership Function: A Deck of Cards based Co-constructive Approach

Optimus-2: Multimodal Minecraft Agent with Goal-Observation-Action Conditioned Policy

Learning to Plan with Personalized Preferences

Exponential Speedups by Rerooting Levin Tree Search

A Unified Framework for Motion Reasoning and Generation in Human Interaction

Agent-Oriented Planning in Multi-Agent Systems

Dynamic Analysis and Adaptive Discriminator for Fake News Detection

A Practical Review of Mechanistic Interpretability for Transformer-Based Language Models

AI Data Readiness Inspector (AIDRIN) for Quantitative Assessment of Data Readiness for AI

Nondeterministic Causal Models

X-SHIELD: Regularization for eXplainable Artificial Intelligence

Categorical semantics of compositional reinforcement learning

Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs

Created by

Haebom

저자

Ling Team, Binwei Zeng, Chao Huang, Chao Zhang, Changxin Tian, Cong Chen, Dingnan Jin, Feng Yu, Feng Zhu, Feng Yuan, Fakang Wang, Gangshan Wang, Guangyao Zhai, Haitao Zhang, Huizhong Li, Jun Zhou, Jia Liu, Junpeng Fang, Junjie Ou, Jun Hu, Ji Luo, Ji Zhang, Jian Liu, Jian Sha, Jianxue Qian, Jiewei Wu, Junping Zhao, Jianguo Li, Jubao Feng, Jingchao Di, Junming Xu, Jinghua Yao, Kuan Xu, Kewei Du, Longfei Li, Lei Liang, Lu Yu, Li Tang, Lin Ju, Peng Xu, Qing Cui, Song Liu, Shicheng Li, Shun Song, Song Yan, Tengwei Cai, Tianyi Chen, Ting Guo, Ting Huang, Tao Feng, Tao Wu, Wei Wu, Xiaolu Zhang, Xueming Yang, Xin Zhao, Xiaobo Hu, Xin Lin, Yao Zhao, Yilong Wang, Yongzhen Guo, Yuanyuan Wang, Yue Yang, Yang Cao, Yuhao Fu, Yi Xiong, Yanzhe Li, Zhe Li, Zhiqiang Zhang, Ziqi Liu, Zhaoxin Huan, Zujie Wen, Zhenhang Sun, Zhuoxuan Du, Zhengyu He

개요

본 논문은 대규모 전문가 혼합(MoE) 모델 훈련의 비효율적인 비용과 자원 제약을 극복하는 데 중점을 두고 있습니다. 이를 위해 매개변수 수가 168억 개(활성 매개변수 27.5억 개)인 Ling-Lite와 2900억 개(활성 매개변수 288억 개)인 Ling-Plus(중국어로 Bailing) 두 가지 크기의 MoE 대규모 언어 모델(LLM)을 제시합니다. 두 모델 모두 주요 업계 벤치마크와 비슷한 성능을 보이며, 자원 제약 환경에서 AI 개발의 효율성과 접근성을 향상시키는 실행 가능한 통찰력을 제공합니다. 모델 아키텍처 및 훈련 프로세스 최적화, 훈련 이상 현상 처리 개선, 모델 평가 효율 향상을 위한 혁신적인 방법을 제안하여 대규모 MoE 모델의 훈련 비용을 절감합니다. 지식 그래프에서 생성된 고품질 데이터를 활용하여 다른 모델보다 우수한 도구 사용 능력을 보여줍니다. 실험 결과, 3000억 매개변수 MoE LLM을 저성능 장치에서 효과적으로 훈련하여 유사한 규모의 밀집 모델 및 MoE 모델과 비슷한 성능을 달성할 수 있음을 보여줍니다. 사전 훈련 단계에서 저사양 하드웨어 시스템을 사용하면 고성능 장치에 비해 컴퓨팅 비용을 약 20% 절감할 수 있습니다. 모델은 https://huggingface.co/inclusionAI 에서 접근 가능합니다.

inclusionAI (inclusionAI)

Org profile for inclusionAI on Hugging Face, the AI community building the future.

시사점, 한계점

•

시사점:

◦

대규모 MoE LLM을 저사양 하드웨어에서 효율적으로 훈련하는 방법 제시.

◦

훈련 비용을 약 20% 절감하는 비용 효율적인 훈련 전략 제시.

◦

지식 그래프 기반 고품질 데이터를 활용하여 향상된 도구 사용 능력을 보임.

◦

168억 및 2900억 매개변수의 두 가지 크기의 MoE LLM (Ling-Lite, Ling-Plus)을 공개.

◦

업계 최고 수준의 성능과 비교 가능한 성능 달성.

•

한계점:

◦

본 논문에서 제시된 방법의 일반화 가능성에 대한 추가적인 연구가 필요.

◦

다양한 하드웨어 환경에서의 성능 평가가 추가적으로 필요.

◦

특정 하드웨어 환경에 최적화된 방법일 수 있으므로 다른 환경으로의 일반화 가능성을 검증해야 함.

Made with SlashPage