R
Published on

ACL 2026 — Code & Software Engineering

Code & Software Engineering

100 papers Links not yet available — ACL proceedings pending on ACL Anthology.

  • Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding
  • CRISP: Persistent Concept Unlearning via Sparse Autoencoders
  • What is a protest anyway? Codebook conceptualization is still a first-order concern in LLM-era classification
  • Mechanistic Interpretability Should Prioritize Feature Consistency in Sparse Autoencoders
  • CodeHacker: Automated Test Case Generation for Detecting Vulnerabilities in Competitive Programming Solutions
  • SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
  • TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation
  • Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders
  • CODERL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
  • Saber: Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model in Code Generation
  • CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
  • VideoPro: Adaptive Program Reasoning for Long Video Understanding
  • ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch
  • From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning
  • Beyond Monolingual Assumptions: A Survey on Code-Switched NLP in the Era of Large Language Models across Modalities
  • MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution
  • From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
  • XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
  • “Newspaper Eat” Means “Not Tasty”: A Taxonomy and Benchmark for Coded Language in Real-World Chinese Online Reviews
  • CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback
  • CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval
  • Lifting Optimized Binaries to Canonical Compiler IR via Structure-Aware Retrieval and Iterative Verification
  • WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
  • Adaptive Prompt Structure Factorization: A Framework for Self-Discovering and Optimizing Compositional Prompt Programs
  • Cognitive Alpha Mining via LLM-Driven Code-Based Evolution
  • KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMs
  • CODESTRUCT: Code Agents over Structured Action Spaces
  • From Charts to Code: A Hierarchical Benchmark for Multimodal Models
  • ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
  • Map of Encoders – Mapping Sentence Encoders using Quantum Relative Entropy
  • ReFEree: Reference-Free and Fine-Grained Method for Evaluating Factual Consistency in Real-World Code Summarization
  • When “Correct” Is Not Safe: Can We Trust Functionally Correct Patches Generated by Code Agents?
  • ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation
  • The Path Not Taken: Duality in Reasoning about Program Execution
  • SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion
  • Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults
  • DisCo_Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec
  • Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings
  • StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation
  • CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
  • DeepGuard: Secure Code Generation via Multi-Layer Semantic Aggregation
  • Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders
  • HSCodeComp: A Realistic and Expert-level Agent Benchmark for Hierarchical Rule Application
  • Aligned Multi-View Scripts for Universal Chart-to-Code Generation
  • Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible Multilinguality
  • Controllable LLM Reasoning via Sparse Autoencoder‑Based Steering
  • Causal2Vec: Improving Decoder-only LLMs as Embedding Models through a Contextual Token
  • FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean
  • BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
  • Scaling Laws for Code: A More Data-Hungry Regime
  • CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution
  • EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention
  • AIRCoder: Adaptive Integration of Multi-dimensional Retrieval for Repository-level Code Completion
  • From Logical to Computational Sparsity: Structure-Aware Block-Sparse Attention for Long-Code Completion
  • Selective Knowledge Distillation: Fusing LLM Semantic Strengths with DNN Efficiency for Binary Code Similarity Detection
  • CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks
  • Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
  • KoCo-Bench: Can Large Language Models Leverage Domain Knowledge in Software Development?
  • QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization
  • EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering
  • MavenCoder: Competitive Code Generation via Model Adaptive Planning Strategies and Multi-Perspective Verification Enhancement
  • Do LLMs Encode Functional Importance of Reasoning Tokens ?
  • UniVocal: Unified Speech-Singing Code-Switching Synthesis
  • RedCoder: Automated Multi-Turn Red Teaming for Code LLMs
  • MARS²: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
  • Multilingual Language Models Encode Script Over Linguistic Structure
  • Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
  • MMSciCode: Real-world Evaluation of Multilingual Multi-Discipline Scientific Research Coding
  • Corpus-Dependent Subcharacter Encoding via HMM-Guided Code Assignment
  • E2EDev: Benchmarking Large Language Models in End-to-End Software Development Task
  • Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs
  • SeDev: Structured Semantic Exploration for LLM-Driven Code Generation
  • EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
  • SLICEFORMER: Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding
  • TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction
  • LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation
  • Bootstrapping Code Translation with Weighted Multilanguage Exploration
  • PaT: Planning-after-Trial for Efficient Test-Time Code Generation
  • Frozen LLMs are Native Decoders for High-Norm Semantic Vectors
  • Example Quality Matters: Multi-Aspects Example Augmentation for Private Library Programming
  • Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards
  • Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation
  • CodeRipple: Wavelet-Based Detection of LLM-Generated Code
  • SciCoQA: Quality Assurance for Scientific Paper–Code Alignment
  • From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution
  • PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
  • RealChart2Code: Bridging the Gap in Real-World Chart-to-Code Generation via Multi-Task Evaluation
  • From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
  • Programming over Thinking: Efficient and Robust Multi-Constraint Planning
  • ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
  • Late Code Chunking: A Code Chunking Strategy for Repository-Level Code Completion
  • CLAOCS-TX: Cross-Lingual Triplet Extraction with Aspect-Opinion-Aware Code-Switched Prompting and LLM-Guided Contrastive Distillation
  • HSGraphAgent: Knowledge-Graph-Guided Large Language Models for Harmonized System Code Classification
  • Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text
  • LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software
  • OLA: Output Language Alignment in Code-Switched LLM Interactions
  • GitChameleon 2.0: Evaluating AI Code Generation Against Python Library Version Incompatibilities
  • One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness
  • TokDrift: When LLM Speaks in Subwords but Code Speaks in Grammar