haebom
Sign In
Daily Arxiv
New
전 세계에서 발간되는 인공지능 관련 논문을 정리하는 페이지 입니다. 본 페이지는 Google Gemini를 활용해 요약 정리하며, 비영리로 운영 됩니다. 논문에 대한 저작권은 저자 및 해당 기관에 있으며, 요약본 공유 시 출처만 명기하면 됩니다. This service is supported by Google Gemini.
DENSE: Distilling Agent Trajectories into Evidence-Grounded Shortcut Trees for Self-Refinement
Offline Multimodal Large Language Models for Decision Support in Air Operations
LEGIT: Credentialing Protocol for Trustworthy AI Agent Marketplaces
GameASG-Bench: Benchmarking Autonomous Software Generation for Game Development
Efficient Benchmarking in Production: A Study of an Evolving LLM Agent
PlaceReasoner-Beta: Reasoning-Driven Macro Placement and Benchmarking
CogGym: Towards Large-Scale Comparative Evaluation of Human and Machine Cognition
A Fully Differentiable Neuro-Soft-Symbolic Framework for Perceptual Task Planning
Ability-Residual Decoupled Modeling for Affective Cognitive Diagnosis
Information-Gain Rewards over Diversity-Pruned Tests: GT-Anchored Verifier Co-Training for Reliable Code Generation
AI-GRACE: A Use-Case Operationalization Framework for Agentic AI: From Organizational Objectives and Obligations to Deployment Capabilities and Architecture
Implicit Rule Induction with Test-Time Task Embeddings in ARC-like Tasks
SpecOpt: Contact-Diff Reasoning for Agentic Molecule Optimization Toward Binding Specificity
Can Agents Design Better Chips with a Higher Level Abstraction?
Clinician-Grounded Quality Assurance for AI-Assisted Psychiatric Intake
TinyCeNN-LM: Quality-Gated Conversion of Pretrained Attention with CeNN-Inspired Cellular-Recurrent Layers
Decoupling Internal Representational Changes and Causal Importance in Fine-Tuned Large Language Models
Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing
LoRA Enhanced Contrastive Learning with SAS Vision Transformers
CaLR: Causal Latent Revision for Robust Diffusion Reasoning
Attention-Aware Routing: Coupling Routing and Attention in MoEs
RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models
Do AI Agents Understand Computer Architecture?
Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses
What Do Current Systematic Generalization Tasks Miss? A Reasoning-Centered Analysis
Position: It is Time to Virtualize Foundation Models with a Self-evolving Operating System Layer
What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks
BioPhys-Bridge: A Benchmark for Interdisciplinary Scientific Reasoning in Physics-Grounded Biological Research
Regularized Emphatic Temporal-Difference Learning: Stability under Constant Stepsizes
SNOMED CT Concept Recommendation from Masked Clinical Context
Learning Heterogeneous Preferences
A Four-Stage Decomposition of Word-Problem Solving and Mechanistic Fragility in LLM Math Reasoning
FairCompressAgent: An Agentic Framework for Fairness-Aware Model Compression for FPGA Deployment
SAGE: Governed Artifact Generation from Enterprise Guidelines
Imitation Learning for Autonomous Driving in CARLA
A Systematic Evaluation of the COTQ Provincial Land Cover Product: Structural Consistency, Spectral Separability, and Relative Positioning Against ESA, ESRI, and Google Products
NeMo Data Designer: An Extensible Framework for Multimodal Synthetic Data Generation
GVD: Governed Versioning and Deduplication for Document Repositories
GraphEcho: Structural Redundancy and Evidence Provenance in LLM Graph Agents
CapMem: A Benchmark for Caption-Based Episodic Memory in Egocentric Video
What You Can't See Is Still What You Learn: A Preregistered Sixty-Society Confirmation That Evidence Masking Drives Compositional Generalization
Physics-Constrained Digital Twins for Sensor Integrity in Urban Pedestrian Flow: Detecting Stealthy False Data Injection with Conformal Guarantees
One Color Preprocessing Improves DSATUR
EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents
Making AI-Assisted Claims Independently Challengeable: Publication Authority and a Protocol for Falsifiable Publication Records
Calibrate, Then Route: A Measured Study of Learned Request Routing for Disaggregated LLM Serving
Position: AI Is Not Ready for Strategic Conflicts
GPEvac: GNN-Based PPO for Adaptive Evacuation Routing During Shooting Events
Safe Error Correction for Language Models: Frozen-Base Adjustment with Capability Preservation
Optimal Pruning for Neural Architectures using Fisher Information Distances
How User-AI Mistreatment Occurs and Matters in Conversational Systems?
Causal multi-modal AI for personalized chemosensitivity prediction
Planning or Learning: Reliability and Cost in Multi-Asset Maintenance
A Hybrid Agentic AI Framework for Intelligent Supply Chain Analytics
Carbon-Aware Routing for Function Calling in Edge-Cloud LLM Systems
Toward a Decision-Assurance Layer for AI-Assisted Flight Planning in Air Traffic Management
AutoTailor: Automatic, User-Aligned Capability Selection and Adaptation for Web Agents
Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents
From Legal Text to AI-specific Risk Sources: A Systematic Analysis of the EU AI Act's High-Risk Requirements
Fraglingo: Molecular Design via Attachment-Aware Autoregressive Fragment Generation
Token Efficient Task Execution via Application Behavior Modeling for Web Agents
Grounded Adjudication of Variations across Extracted TimeLines (GAVEL): Comparing Clinical Timelines Against Their Case Reports
OrchSLM: Probing the Dynamics of Small Language Model Orchestration
Governing at Machine Speed: An Adaptive Intelligence Architecture for Real-Time AI Policy Enforcement
Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures
TimeThink: Eliciting Compositional Reasoning in Timeseries Large Language Models
LabAgent: Customize Any Research Hubs for Scientific Discoveries Using AI Agents
Toward Self-Adaptive Physical AI: Can LLM Agents Manage Long-Horizon Physical Tasks?
Vibe Patenting: Evaluating LLM Judges for Professional Patent-Drafting Agents
Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement
Converge Then Diversify: Decoupling Convergence and Diversity in Multi-Objective Bayesian Optimisation
ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
Can LLMs in Draft-Verify-Revise Pipelines Resolve Deictic Ambiguity?
Mined from Scientific Literature: Process Schemas for Atomic Layer Deposition and Etching in Materials Science
When Successful Knowledge Graph Edits Displace Correct Answers: Rank-Level Locality beyond Parameter Support
DU-NO: A Parameter-Efficient Double U-Shaped Neural Operator for Phase-Resolving Wave Modeling
Language Is an Insufficient Substrate for Quantitative Reasoning, and Consequential Domains Need Large Quantitative Models
Competence-Gated Pooling of Language Models and Priors for Event Forecasting
Reading the Whole Heart: Latent-Attention Masked Autoencoders for Multimodal Cardiac Representation Learning
Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite
Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work
Autonomous Chemical Mechanistic Discovery through Agentic Reasoning and Validation
The Oligarch Barely Steers Model Collapse in Multi-Model Ecosystems
Same Day, Same Story; One Day Ahead, a Different Signal: The Dual Validity of Financial Sentiment
KuaiRP Series Role-playing Models Technical Report
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation
MOSAIC: Query-Aware Exploration Policy Adaptation for GraphRAG
Fork Where the Model Changes Its Mind: Belief-Shift Branching for Tree-Structured Reinforcement Learning
Grounding Agent Memory: Environment-Probing Curation for Enterprise Agents
The Agent Incident Registry: Toward Preventing Repeated AI Agent Failures
Defining AI Agents: A Compendium of Criteria, Metrics, and Benchmarks
Demystifying the Privacy-Utility Trade-off in LLM Interactions
Decoupling Readiness from Release for Tail-Aware Scheduling of Agentic LLM Workflows
When Validation Stops Learning: Auditing Update Admission for Continual Embodied Agents
Studying Without a Syllabus: Task-Agnostic Environment Preprocessing
Towards a Deterministic Math Solver for Clinical Language Models
Finishing the Task Is Not Enough: Evaluating Agent Resilience and Considerate Participation under Accumulating Challenge
An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking
Understanding LoRA Rank Trade-offs in Diffusion Model Fine-Tuning
Load more
New
Made with Slashpage