Character-level Convolutional Networks for Text Classification
2015/09/04 by Xiang Zhang, Junbo Zhao, Zhang, Xiang +3 · 195 citations
Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Text and Document Classification Technologies #Topic Modeling
paper · pdf · doi:10.48550/arxiv.1509.01626
openalex publication_date 2015/09/04 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
This article offers an empirical exploration on the use of character-level convolutional networks (ConvNets) for text classification. We constructed several large-scale datasets to show that character-level convolutional networks could achieve state-of-the-art or competitive results. Comparisons are offered against traditional models such as bag of words, n-grams and their TFIDF variants, and deep learning models such as word-based ConvNets and recurrent neural networks.
Citations
Cited by
- Fine-Tuning LLMs with Fine-Grained Human Feedback on Text Spans
- Automated Numerical Stability Analysis of Deep Learning Operators
- When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness
- Clust-PSI-PFL: A Population Stability Index Approach for Clustered Non-IID Personalized Federated Learning
- HATS: High-Accuracy Triple-Set Watermarking for Large Language Models
- MAGIC: Achieving Superior Model Merging via Magnitude Calibration
- The Interaction Bottleneck of Deep Neural Networks: Discovery, Proof, and Modulation
- Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models
- From Fake Focus to Real Precision: Confusion-Driven Adversarial Attention Learning in Transformers
- From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection
- Convolutional Lie Operator for Sentence Classification
- PerProb: Indirectly Evaluating Memorization in Large Language Models
- Measuring Uncertainty Calibration
- Reducing Label Dependency in Human Activity Recognition with Wearables: From Supervised Learning to Novel Weakly Self-Supervised Approaches
- Rethinking Label Consistency of In-Context Learning: An Implicit Transductive Label Propagation Perspective
- PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data
- THeGAU: Type-Aware Heterogeneous Graph Autoencoder and Augmentation
- Interpreto: An Explainability Library for Transformers
- Text2Graph: Combining Lightweight LLMs and GNNs for Efficient Text Classification in Label-Scarce Scenarios
- Improving Multi-Class Calibration through Normalization-Aware Isotonic Techniques
- Patronus: Identifying and Mitigating Transferable Backdoors in Pre-trained Language Models
- TopiCLEAR: Topic extraction by CLustering Embeddings with Adaptive dimensional Reduction
- LOCUS: A System and Method for Low-Cost Customization for Universal Specialization
- PrivCode: When Code Generation Meets Differential Privacy
- What Language is This? Ask Your Tokenizer
- Technical Report on Text Dataset Distillation
- Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks
- One Swallow Does Not Make a Summer: Understanding Semantic Structures in Embedding Spaces
- Resolving Conflicts in Lifelong Learning via Aligning Updates in Subspaces
- SuRe: Surprise-Driven Prioritised Replay for Continual LLM Learning
- Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models
- Semantic Anchors in In-Context Learning: Why Small LLMs Cannot Flip Their Labels
- Geometry of Decision Making in Language Models
- When +1% Is Not Enough: A Paired Bootstrap Protocol for Evaluating Small Improvements
- MoodBench 1.0: An Evaluation Benchmark for Emotional Companionship Dialogue Systems
- Re-Key-Free, Risky-Free: Adaptable Model Usage Control
- A Lightweight Approach to Detection of AI-Generated Texts Using Stylometric Features
- PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
- DelTriC: A Novel Clustering Method with Accurate Outlier
- Attention-Guided Feature Fusion (AGFF) Model for Integrating Statistical and Semantic Features in News Text Classification
- Beyond Tokens in Language Models: Interpreting Activations through Text Genre Chunks
- ILoRA: Federated Learning with Low-Rank Adaptation for Heterogeneous Client Aggregation
- GPS: General Per-Sample Prompter
- Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
- Mitigating Label Length Bias in Large Language Models
- Steganographic Backdoor Attacks in NLP: Ultra-Low Poisoning and Defense Evasion
- SnapAudit: Active Auditing of Differentially Private In-Context Learning via Snapshot-Based Simulation
- RegionMarker: A Region-Triggered Semantic Watermarking Framework for Embedding-as-a-Service Copyright Protection
- Generalization Bounds for Semi-supervised Matrix Completion with Distributional Side Information
- Private Zeroth-Order Optimization with Public Data
- Advanced Black-Box Tuning of Large Language Models with Limited API Calls
- AdaptDel: Adaptable Deletion Rate Randomized Smoothing for Certified Robustness
- Zero-Order Sharpness-Aware Minimization
- iSeal: Encrypted Fingerprinting for Reliable LLM Ownership Verification
- Class-feature Watermark: A Resilient Black-box Watermark Against Model Extraction Attacks
- Synergy over Discrepancy: A Partition-Based Approach to Multi-Domain LLM Fine-Tuning
- Graph Representation-based Model Poisoning on the Heterogeneous Internet of Agents
- CAE: Character-Level Autoencoder for Non-Semantic Relational Data Grouping
- Federated Stochastic Minimax Optimization under Heavy-Tailed Noises
- Differentially Private In-Context Learning with Nearest Neighbor Search
- On Joint Regularization and Calibration in Deep Ensembles
- Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
- Multi-refined Feature Enhanced Sentiment Analysis Using Contextual Instruction
- Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs
- Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
- Mixture-of-Transformers Learn Faster: A Theoretical Study on Classification Problems
- Don't Let It Fade: Preserving Edits in Diffusion Language Models via Token Timestep Allocation
- Scalable Utility-Aware Multiclass Calibration
- From Cross-Task Examples to In-Task Prompts: A Graph-Based Pseudo-Labeling Framework for In-context Learning
- A high-capacity linguistic steganography based on entropy-driven rank-token mapping
- Simple Denoising Diffusion Language Models
- Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
- SALSA: Single-pass Autoregressive LLM Structured Classification
- Power to the Clients: Federated Learning in a Dictatorship Setting
- Frequentist Validity of Epistemic Uncertainty Estimators
- DictPFL: Efficient and Private Federated Learning on Encrypted Gradients
- Do Prompts Reshape Representations? An Empirical Study of Prompting Effects on Embeddings
- HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
- Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall
- Learning Task-Agnostic Representations through Multi-Teacher Distillation
- Ensembling Pruned Attention Heads For Uncertainty-Aware Efficient Transformers
- Latent-Augmented Discrete Diffusion Models
- Fighter: Unveiling the Graph Convolutional Nature of Transformers in Time Series Modeling
- Rotation, Scale, and Translation Resilient Black-box Fingerprinting for Intellectual Property Protection of EaaS Models
- The Hidden Cost of Modeling P(X): Vulnerability to Membership Inference Attacks in Generative Text Classifiers
- A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space
- FedHFT: Efficient Federated Finetuning with Heterogeneous Edge Clients
- CurLL: A Developmental Framework to Evaluate Continual Learning in Language Models
- Market-Driven Subset Selection for Budgeted Training
- FedHybrid: Breaking the Memory Wall of Federated Learning via Hybrid Tensor Management
- Investigating Large Language Models' Linguistic Abilities for Text Preprocessing
- Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models
- Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
- On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters
- Meta-Harness: End-to-End Optimization of Model Harnesses
- Myopic Bayesian Decision Theory for Batch Active Learning with Partial Batch Label Sampling
- MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
- Rethinking Reasoning: A Survey on Reasoning-based Backdoors in LLMs
- Gamma Mixture Modeling for Cosine Similarity in Small Language Models
- Beyond Random: Automatic Inner-loop Optimization in Dataset Distillation
- P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
- Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models
- RACE Attention: A Strictly Linear-Time Attention Layer for Training on Outrageously Large Contexts
- What Is The Performance Ceiling of My Classifier? Utilizing Category-Wise Influence Functions for Pareto Frontier Analysis
- GLAI: GreenLightningAI for Accelerated Training through Knowledge Decoupling
- Robust Federated Inference
- TAP: Two-Stage Adaptive Personalization of Multi-task and Multi-Modal Foundation Models in Federated Learning
- Submodular Context Partitioning and Compression for In-Context Learning
- Vision Function Layer in Multimodal LLMs
- AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees
- CURA: Size Isnt All You Need -- A Compact Universal Architecture for On-Device Intelligence
- Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
- Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention
- IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
- Question-Driven Analysis and Synthesis: Building Interpretable Thematic Trees with LLMs for Text Clustering and Controllable Generation
- Backdoor Attribution: Elucidating and Controlling Backdoor in Language Models
- SAGE: A Realistic Benchmark for Semantic Understanding
- LLMTrace: A Corpus for Classification and Fine-Grained Localization of AI-Written Text
- Explaining Grokking and Information Bottleneck through Neural Collapse Emergence
- Stability of In-Context Learning: A Spectral Coverage Perspective
- Every Character Counts: From Vulnerability to Defense in Phishing Detection
- Efficiently Attacking Memorization Scores
- Enhancing the Effectiveness and Durability of Backdoor Attacks in Federated Learning through Maximizing Task Distinction
- Diversity Boosts AI-Generated Text Detection
- Trigger Where It Hurts: Unveiling Hidden Backdoors through Sensitivity with Sensitron
- Data Efficient Adaptation in Large Language Models via Continuous Low-Rank Fine-Tuning
- BASFuzz: Towards Robustness Evaluation of LLM-based NLP Software via Automated Fuzz Testing
- Clotho: Measuring Task-Specific Pre-Generation Test Adequacy for LLM Inputs
- AIMMerging: Adaptive Iterative Model Merging Using Training Trajectories for Language Model Continual Learning
- LLM-Guided Co-Training for Text Classification
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- Who to Trust? Aggregating Client Knowledge in Logit-Based Federated Learning
- Hierarchical Self-Attention: Generalizing Neural Attention Mechanics to Multi-Scale Problems
- SSL-SSAW: Self-Supervised Learning with Sigmoid Self-Attention Weighting for Question-Based Sign Language Translation
- Privacy Preserving In-Context-Learning Framework for Large Language Models
- Forget What's Sensitive, Remember What Matters: Token-Level Differential Privacy in Memory Sculpting for Continual Learning
- A Survey on Retrieval And Structuring Augmented Generation with Large Language Models
- Building High-Quality Datasets for Portuguese LLMs: From Common Crawl Snapshots to Industrial-Grade Corpora
- Label Smoothing++: Enhanced Label Regularization for Training Neural Networks
- Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
- Orthogonal Low-rank Adaptation in Lie Groups for Continual Learning of Large Language Models
- Benchmarking Robust Aggregation in Decentralized Gradient Marketplaces
- CURE: Controlled Unlearning for Robust Embeddings -- Mitigating Conceptual Shortcuts in Pre-Trained Language Models
- PracMHBench: Re-evaluating Model-Heterogeneous Federated Learning Based on Practical Edge Device Constraints
- EverTracer: Hunting Stolen Large Language Models via Stealthy and Robust Probabilistic Fingerprint
- Implicit Reasoning in Large Language Models: A Comprehensive Survey
- Attributes as Textual Genes: Leveraging LLMs as Genetic Algorithm Simulators for Conditional Synthetic Data Generation
- Guess-and-Learn (G&L): Measuring the Cumulative Error Cost of Cold-Start Adaptation
- Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation
- FFT-MoE: Efficient Federated Fine-Tuning for Foundation Models via Large-scale Sparse MoE under Heterogeneous Edge
- CoBA: Counterbias Text Augmentation for Mitigating Various Spurious Correlations via Semantic Triples
- Evaluating Sparse Autoencoders for Monosemantic Representation
- SDEC: Semantic Deep Embedded Clustering
- RepreGuard: Detecting LLM-Generated Text by Revealing Hidden Representation Patterns
- Hierarchical Conformal Classification
- SoK: Data Minimization in Machine Learning
- When Explainability Meets Privacy: An Investigation at the Intersection of Post-hoc Explainability and Differential Privacy in the Context of Natural Language Processing
- Pruning and Malicious Injection: A Retraining-Free Backdoor Attack on Transformer Models
- Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models
- Biased Local SGD for Efficient Deep Learning on Heterogeneous Systems
- Integrating attention into explanation frameworks for language and vision transformers
- Gradient Surgery for Safe LLM Fine-Tuning
- SLIP: Soft Label Mechanism and Key-Extraction-Guided CoT-based Defense Against Instruction Backdoor in APIs
- ALScope: A Unified Toolkit for Deep Active Learning
- GeRe: Towards Efficient Anti-Forgetting in Continual Learning of LLM via General Samples Replay
- DTPA: Dynamic Token-level Prefix Augmentation for Controllable Text Generation
- PromptAL: Sample-Aware Dynamic Soft Prompts for Few-Shot Active Learning
- Guided Perturbation Sensitivity (GPS): Detecting Adversarial Text via Embedding Stability and Word Importance
- VFLAIR-LLM: A Comprehensive Framework and Benchmark for Split Learning of LLMs
- MLP Memory: A Retriever-Pretrained Memory for Large Language Models
- DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
- Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders
- A Bayesian Hybrid Parameter-Efficient Fine-Tuning Method for Large Language Models
- Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning
- XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
- An Explainable Emotion Alignment Framework for LLM-Empowered Agent in Metaverse Service Ecosystem
- Modular Delta Merging with Orthogonal Constraints: A Scalable Framework for Continual and Reversible Model Composition
- Contrast-CAT: Contrasting Activations for Enhanced Interpretability in Transformer-based Text Classifiers
- GLiNER2: An Efficient Multi-Task Information Extraction System with Schema-Driven Interface
- LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
- Toward Efficient Uncertainty in LLMs through Evidential Knowledge Distillation
- The Tsetlin Machine Goes Deep: Logical Learning and Reasoning With Graphs
- Tiny language models
- GRID: Scalable Task-Agnostic Prompt-Based Continual Learning for Language Models
- VMask: Tunable Label Privacy Protection for Vertical Federated Learning via Layer Masking
- Political Leaning and Politicalness Classification of Texts
- GhostUMAP2: Measuring and Analyzing (r,d)-Stability of UMAP
- FedDPG: An Adaptive Yet Efficient Prompt-tuning Approach in Federated Learning Settings
- Enhancing Cross-task Transfer of Large Language Models via Activation Steering
- Text-ADBench: Text Anomaly Detection Benchmark based on LLMs Embedding
- Bridging Robustness and Generalization Against Word Substitution Attacks in NLP via the Growth Bound Matrix Approach
- Post-Training Quantization of Generative and Discriminative LSTM Text Classifiers: A Study of Calibration, Class Balance, and Robustness
- Balanced Training Data Augmentation for Aspect-Based Sentiment Analysis
- GNN-CNN: An Efficient Hybrid Model of Convolutional and Graph Neural Networks for Text Representation
- Bridging KAN and MLP: MJKAN, a Hybrid Architecture with Both Efficiency and Expressiveness
Related