- Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers
2023/01/05 by Chengyi Wang, Wang, Chengyi, Sanyuan Chen +23 · 1 voice · 268 citations
Computer Science · Engineering · #Audio and Speech Processing (eess.AS) #Code-excited linear prediction #Codec #Codec2 #Computation and Language (cs.CL) #Computer science #Context (archaeology) #FOS: Computer and information sciences #FOS: Electrical engineering #Language model #Linear predictive coding #Natural language processing #Naturalness #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #Speech coding #Speech recognition #Speech synthesis #Task (project management) #Topic Modeling #cs.CL #cs.SD #eess.AS #electronic engineering #information engineering
- DeAR: A Deep-learning-based Audio Re-recording Resilient Watermarking
2022/12/05 by Chang Liu, Liu, Chang, Jie Zhang +8 · 12 citations
Computer Science · #Advanced Steganography and Watermarking Techniques #Artificial intelligence #Audio and Speech Processing (eess.AS) #Audio signal #Bandwidth (computing) #Computer science #Computer vision #Cryptography and Security (cs.CR) #Deep learning #Digital Media Forensic Detection #Digital watermarking #Distortion (music) #Embedding #FOS: Computer and information sciences #FOS: Electrical engineering #Image (mathematics) #Internet Traffic Analysis and Secure E-voting #Multimedia (cs.MM) #Process (computing) #Real-time computing #Robustness (evolution) #Sound (cs.SD) #Speech coding #Speech recognition #Telecommunications #Tracing #Watermark #electronic engineering #information engineering
- Positive Sample Propagation along the Audio-Visual Event Line
2021/04/01 by Jinxing Zhou, Liang Zheng, Zhou, Jinxing +7 · 11 citations
Computer Science · Engineering · #Artificial intelligence #Audio and Speech Processing (eess.AS) #Audio signal #Audio visual #Classifier (UML) #Computer Vision and Pattern Recognition (cs.CV) #Computer science #Discriminative model #Exploit #FOS: Computer and information sciences #FOS: Electrical engineering #Image (mathematics) #Multimedia #Multimedia (cs.MM) #Music and Audio Processing #Pattern recognition (psychology) #Sample (material) #Similarity (geometry) #Sound (cs.SD) #Speech and Audio Processing #Speech coding #Speech recognition #Video Analysis and Summarization #Visualization #Weighting #cs.CV #cs.MM #cs.SD #eess.AS #electronic engineering #information engineering
- FeatherWave: An efficient high-fidelity neural vocoder with multi-band linear prediction
2020/05/12 by Qiao Tian, Tian, Qiao, Zewang Zhang +7 · 2 citations
Computer Science · Engineering · #Audio and Speech Processing (eess.AS) #Computer science #FOS: Computer and information sciences #FOS: Electrical engineering #Fidelity #High fidelity #Linear prediction #Linear predictive coding #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #Speech coding #Speech processing #Speech recognition #Telecommunications #cs.SD #eess.AS #electronic engineering #information engineering
- SignalTrain: Profiling Audio Compressors with Deep Neural Networks
2019/05/28 by Scott H. Hawley, Hawley, Scott H., Benjamin Colburn +4 · 1 citation
Computer Science · Engineering · #Anomaly Detection Techniques and Applications #Artificial intelligence #Artificial neural network #Audio and Speech Processing (eess.AS) #Audio signal #Audio signal processing #Computer science #Encoder #FOS: Computer and information sciences #FOS: Electrical engineering #I.2.6 #Machine Learning (cs.LG) #Music Technology and Sound Studies #Music and Audio Processing #Nonlinear system #Profiling (computer programming) #Real-time computing #Software #Sound (cs.SD) #Speech coding #Speech recognition #Workflow #cs.LG #cs.SD #eess.AS #electronic engineering #information engineering
- WaveCycleGAN2: Time-domain Neural Post-filter for Speech Waveform Generation
2019/04/05 by Kou Tanaka, Tanaka, Kou, Hirokazu Kameoka +5 · 3 citations
Computer Science · Engineering · Mathematics · #Aliasing #Artificial intelligence #Artificial neural network #Audio and Speech Processing (eess.AS) #Computer science #FOS: Computer and information sciences #FOS: Electrical engineering #Filter (signal processing) #Linear predictive coding #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Mathematics #Music and Audio Processing #Parametric statistics #Sampling (signal processing) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #Speech coding #Speech processing #Speech recognition #Speech synthesis #Statistics #Telecommunications #Time domain #Voice activity detection #Waveform #cs.LG #cs.SD #eess.AS #electronic engineering #information engineering #stat.ML
- Adversarial Attacks Against Automatic Speech Recognition Systems via\n Psychoacoustic Hiding
2018/08/16 by Lea Schönherr, Schönherr, Lea, Katharina Kohls +7 · 12 citations
Computer Science · Engineering · #Artificial intelligence #Artificial neural network #Audio and Speech Processing (eess.AS) #Audio signal #Backpropagation #Computer science #Cryptography and Security (cs.CR) #Digital Media Forensic Detection #Exploit #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Perception #Psychoacoustics #Reverberation #Sound (cs.SD) #Speech and Audio Processing #Speech coding #Speech recognition #cs.CR #cs.SD #eess.AS #electronic engineering #information engineering
- Audio Adversarial Examples: Targeted Attacks on Speech-to-Text
2018/05/01 by Nicholas Carlini, David Wagner · 6 citations
Computer Science · Mathematics · #Adversarial Robustness in Machine Learning #Adversarial system #Computer science #Phrase #Speech recognition #Construct (python library) #Domain (mathematical analysis) #Speech coding #Waveform #Artificial intelligence #Natural language processing #Mathematics #Programming language #Telecommunications
- Speex: A Free Codec For Free Speech
2016/02/28 by Jean-Marc Valin, Valin, Jean-Marc · 3 citations
Computer Science · Engineering · #Adaptive Multi-Rate audio codec #Advanced Adaptive Filtering Techniques #Advanced Data Compression Techniques #Code-excited linear prediction #Codec #Codec2 #Computer network #Computer science #FOS: Computer and information sciences #Free speech #Full Rate #Latency (audio) #Linear predictive coding #Network packet #Sound (cs.SD) #Speech and Audio Processing #Speech coding #Speech processing #Speech recognition #Telecommunications #Vector sum excited linear prediction #Voice activity detection #cs.SD