- Published on
ACL 2026 — Code & Software Engineering
Code & Software Engineering
100 papers Links not yet available — ACL proceedings pending on ACL Anthology.
- Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding
- CRISP: Persistent Concept Unlearning via Sparse Autoencoders
- What is a protest anyway? Codebook conceptualization is still a first-order concern in LLM-era classification
- Mechanistic Interpretability Should Prioritize Feature Consistency in Sparse Autoencoders
- CodeHacker: Automated Test Case Generation for Detecting Vulnerabilities in Competitive Programming Solutions
- SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
- TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation
- Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders
- CODERL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
- Saber: Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model in Code Generation
- CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
- VideoPro: Adaptive Program Reasoning for Long Video Understanding
- ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch
- From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning
- Beyond Monolingual Assumptions: A Survey on Code-Switched NLP in the Era of Large Language Models across Modalities
- MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution
- From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
- XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
- “Newspaper Eat” Means “Not Tasty”: A Taxonomy and Benchmark for Coded Language in Real-World Chinese Online Reviews
- CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback
- CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval
- Lifting Optimized Binaries to Canonical Compiler IR via Structure-Aware Retrieval and Iterative Verification
- WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
- Adaptive Prompt Structure Factorization: A Framework for Self-Discovering and Optimizing Compositional Prompt Programs
- Cognitive Alpha Mining via LLM-Driven Code-Based Evolution
- KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMs
- CODESTRUCT: Code Agents over Structured Action Spaces
- From Charts to Code: A Hierarchical Benchmark for Multimodal Models
- ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
- Map of Encoders – Mapping Sentence Encoders using Quantum Relative Entropy
- ReFEree: Reference-Free and Fine-Grained Method for Evaluating Factual Consistency in Real-World Code Summarization
- When “Correct” Is Not Safe: Can We Trust Functionally Correct Patches Generated by Code Agents?
- ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation
- The Path Not Taken: Duality in Reasoning about Program Execution
- SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion
- Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults
- DisCo_Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec
- Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings
- StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation
- CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
- DeepGuard: Secure Code Generation via Multi-Layer Semantic Aggregation
- Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders
- HSCodeComp: A Realistic and Expert-level Agent Benchmark for Hierarchical Rule Application
- Aligned Multi-View Scripts for Universal Chart-to-Code Generation
- Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible Multilinguality
- Controllable LLM Reasoning via Sparse Autoencoder‑Based Steering
- Causal2Vec: Improving Decoder-only LLMs as Embedding Models through a Contextual Token
- FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean
- BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
- Scaling Laws for Code: A More Data-Hungry Regime
- CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution
- EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention
- AIRCoder: Adaptive Integration of Multi-dimensional Retrieval for Repository-level Code Completion
- From Logical to Computational Sparsity: Structure-Aware Block-Sparse Attention for Long-Code Completion
- Selective Knowledge Distillation: Fusing LLM Semantic Strengths with DNN Efficiency for Binary Code Similarity Detection
- CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks
- Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
- KoCo-Bench: Can Large Language Models Leverage Domain Knowledge in Software Development?
- QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization
- EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering
- MavenCoder: Competitive Code Generation via Model Adaptive Planning Strategies and Multi-Perspective Verification Enhancement
- Do LLMs Encode Functional Importance of Reasoning Tokens ?
- UniVocal: Unified Speech-Singing Code-Switching Synthesis
- RedCoder: Automated Multi-Turn Red Teaming for Code LLMs
- MARS²: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
- Multilingual Language Models Encode Script Over Linguistic Structure
- Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
- MMSciCode: Real-world Evaluation of Multilingual Multi-Discipline Scientific Research Coding
- Corpus-Dependent Subcharacter Encoding via HMM-Guided Code Assignment
- E2EDev: Benchmarking Large Language Models in End-to-End Software Development Task
- Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs
- SeDev: Structured Semantic Exploration for LLM-Driven Code Generation
- EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
- SLICEFORMER: Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding
- TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction
- LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation
- Bootstrapping Code Translation with Weighted Multilanguage Exploration
- PaT: Planning-after-Trial for Efficient Test-Time Code Generation
- Frozen LLMs are Native Decoders for High-Norm Semantic Vectors
- Example Quality Matters: Multi-Aspects Example Augmentation for Private Library Programming
- Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards
- Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation
- CodeRipple: Wavelet-Based Detection of LLM-Generated Code
- SciCoQA: Quality Assurance for Scientific Paper–Code Alignment
- From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution
- PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
- RealChart2Code: Bridging the Gap in Real-World Chart-to-Code Generation via Multi-Task Evaluation
- From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
- Programming over Thinking: Efficient and Robust Multi-Constraint Planning
- ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
- Late Code Chunking: A Code Chunking Strategy for Repository-Level Code Completion
- CLAOCS-TX: Cross-Lingual Triplet Extraction with Aspect-Opinion-Aware Code-Switched Prompting and LLM-Guided Contrastive Distillation
- HSGraphAgent: Knowledge-Graph-Guided Large Language Models for Harmonized System Code Classification
- Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text
- LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software
- OLA: Output Language Alignment in Code-Switched LLM Interactions
- GitChameleon 2.0: Evaluating AI Code Generation Against Python Library Version Incompatibilities
- One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness
- TokDrift: When LLM Speaks in Subwords but Code Speaks in Grammar