Online edition: ISSN 2432-6380
[TOP] | [2020] | [2021] | [2022] | [2023] | [2024] | [2025] | [2026] | [Japanese] / [English]
SP2025-1
Gamma-VAE-VC: Voice conversion based on VAE assuming gamma distribution for both latent variables and observation
Nanako Imaichi, Toru Nakashika (UEC)
pp. 1 - 4
SP2025-2
Effects of phoneme duration and pitch on impression rating for singing voice
Miku Fukasawa, Kitahara Reina, Kubota Nina, Shishime Itsuki,, Toda Natsuki, Takemoto Hironori (CIT), Takahashi Jun (OUA)
pp. 5 - 9
SP2025-3
Multi-channel Models Knowledge Distillation for Single-Channel Speech Separation
Daichi Nitsu, Roland Hartanto, Koichi Shinoda (Science Tokyo)
pp. 10 - 15
SP2025-4
[Poster Presentation]
Sentence Estimation Using Neural Machine Translation and Generative AI for a Communication Aid with Finger Movement Input
Matsuri Iwasaki, Masanobu Abe, Sunao Hara (Okayama Univ)
pp. 16 - 21
SP2025-5
[Poster Presentation]
Improving Speaker Similarity in Speech Synthesis for Glossectomy Patients Using a Parallel Corpus of Healthy and Dysarthric Speech from Non-Target Speakers
Masayori Okamura, Masanobu Abe, Sunao Hara (Okayama Univ.)
pp. 22 - 27
SP2025-6
A Study on Fundamental Frequency Estimation of Sound Signal using Asynchronous Detection Technique
Sanchez Sean, Kenichiro Miwa (Salesian Polytechnic)
pp. 28 - 31
SP2025-7
[Poster Presentation]
Computation of radiation transfer characteristics of the lips using simplified geometrical model
Chiune Sato, Kunitoshi Motoki (Hokkai-Gakuen Univ.)
pp. 32 - 36
SP2025-8
(See Japanese page.)
pp. 37 - 43
SP2025-9
(See Japanese page.)
pp. 44 - 51
SP2025-10
A Study on Improving Diffusion-Based Voice Conversion with Consistency Trajectory Models
Ryuichi Hatakeyama, Toru Nakashika (UEC)
pp. 52 - 56
SP2025-11
How to build systematic assisting tools and protocols for classification of acquisition and presentation of sound materials
Hideki Kawahara (Wakayama Univ.), Ken-Ichi Sakakibara (Health Science Univ. Hokkaido), Mitsunori Mizumachi (Kyushu Inst. Tech.), Tatsuya Kitamura (Konan Univ.), Kohei Yatabe (Tokyo Univ. Agri. Tech.)
pp. 57 - 62
SP2025-12
Experimental validation for implementation of online independent low-rank matrix analysis
Taishi Nakashima (Tokyo Metropolitan Univ.)
pp. 63 - 68
SP2025-13
(See Japanese page.)
pp. 69 - 72
SP2025-14
Effects of turn-taking latency and behavior of communication robot on dialogue smoothness
Zhu Kai, Kitamura Tatsuya, Umetani Tomohiro (Konan Univ.)
pp. 73 - 78
SP2025-15
(See Japanese page.)
pp. 79 - 83
SP2025-16
(See Japanese page.)
pp. 84 - 88
SP2025-17
[Poster Presentation]
Consideration of Acoustic Models and Features for the Development of Singing Voice Synthesis System Utilizing Discrete Speech Tokens
Ryoko Arita, Wataru Nakata, Kazuki Yamauchi, Kentaro Seki, Dong Yang, Yuki Saito, Hiroshi Saruwatari (UTokyo)
pp. 89 - 94
SP2025-18
Mutual Shadowing among World English Speakers for Analyzing Factors Affecting Listening Disfluency Based on Shadowee-Shadower Phonation Differences
Akari Fujiwara, Nobuaki Minematsu (UTokyo), Noriko Nakanisi (Kobe Gakuin Univ.), Daisuke Saito (UTokyo)
pp. 95 - 100
SP2025-19
Comparing Phonetic Posteriorgrams Using Optimal Transport with Application to Utterance Comparison in Low-Resource Languages
Kento Osa, Haitong Sun, Nobuaki Minematsu, Daisuke Saito (UTokyo)
pp. 101 - 106
SP2025-20
Generalization Performance Evaluation of Supervised Virtual Microphone Estimator in Diverse Simulated Sound Fields
Kimihiro Hattori, Wen-Chin Huang, Kazuya Takeda, Tomoki Toda (Nagoya Univ.)
pp. 107 - 112
SP2025-21
Autofocus neural beamformer based on steering vector estimation
Reiya Marukawa, Takeshi Yamada (Univ. of Tsukuba)
pp. 113 - 118
SP2025-22
[Poster Presentation]
JATTS: A Comparison-oriented Japanese Text-to-speech Open-sourced Toolkit
Wen-Chin Huang, Lester Violeta, Tomoki Toda (Nagoya Univ.)
pp. 119 - 124
SP2025-23
Adversarial Audio Generation and Transferability Evaluation across Different Speaker Encoders for Voice Privacy Protection
Kotaro Nakamura, Toru Nakashika (UEC)
pp. 125 - 129
SP2025-24
SpREAD: A dataset of Speech-evoked Repeated EEG for Auditory Decoding of continuous Japanese speech
Tomoaki Mizuno (UEC), Yoshiki Sakurai, Natsue Yoshimura (Science Tokyo), Toru Nakashika (UEC)
pp. 130 - 135
Note: Each article is a technical report without peer review, and its polished version will be published elsewhere.