Shuhei Imai

Shuhei Imai (Nuts)

今井 柊平

I work on research and development of speech synthesis technology at Parakeet Inc. Feel free to reach out via X DM or email if you are interested.

Education

  • Apr 2022 – Present
    Omachi-Nose Laboratory, Dept. of Communications Engineering, Graduate School of Engineering, Tohoku University
    Ph.D. Course (on leave)
  • Apr 2021 – Present
  • Apr 2020 – Mar 2022
    Ito-Nose Laboratory, Dept. of Communications Engineering, Graduate School of Engineering, Tohoku University
    Master's Course
  • Apr 2016 – Sep 2019
    Dept. of Electrical, Information and Physics Engineering, School of Engineering, Tohoku University
    Bachelor's Course (3.5-year early graduation)
  • Apr 2013 – Mar 2016
    Department of Information Science, Niigata Prefectural Kokusai Joho High School

Research Interests

  • Speech Generation
    Text-to-Speech, Voice Conversion, Singing Voice Synthesis, Neural Vocoder
  • Speech Representation Learning
    Audio Codecs, Self-Supervised Speech Models, Latent Speech Modeling
  • Speech and Language Modeling
    Autoregressive Models, Multimodal Generation, Omni-modal LLM
  • Robust Speech Processing
    Automatic Speech Recognition, Speech Enhancement, Speech Restoration
  • Generative Modeling
    GANs, Diffusion Models, Flow Matching
  • Signal Processing
    Digital Signal Processing, Acoustic Modeling, Spectral Analysis

Publications

Journal

  1. Fast end-to-end non-parallel voice conversion based on speaker-adaptive neural vocoder with cycle-consistent learning
    Shuhei Imai, Aoi Kanagaki, Takashi Nose, Shogo Fukawa, Akinori Ito
    Acoustical Science and Technology, Vol. 46, No. 1, pp. 116–119, 2025. Paper
  2. Unified model for voice conversion of speech and singing voice using adaptive pitch constraints
    Shogo Fukawa, Takashi Nose, Shuhei Imai, Akinori Ito
    Acoustical Science and Technology, Vol. 46, No. 1, pp. 120–123, 2025. Paper

Peer-Reviewed International Conference

  1. Improving accented speech recognition using data augmentation based on unsupervised text-to-speech synthesis
    Cong-Thanh Do, Shuhei Imai, Rama Doddipatla, Thomas Hain
    Proc. EUSIPCO, pp. 136–140, 2024. arXiv
  2. Improving Pronunciation Clarity of Dysarthric Speech Using CycleGAN with Multiple Speakers
    Shuhei Imai, Takashi Nose, Aoi Kanagaki, Satoshi Watanabe, Akinori Ito
    Proc. GCCE, pp. 488–489, 2020.

National Convention & Workshop

  1. Human Fooling Rateテストに基づく最先端の日本語テキスト音声合成モデルの評価および分析
    齋藤佑樹, Wen-Chin Huang, 榎本悠久, 今井柊平
    情報処理学会研究報告, 2026-SLP-160, 5 pages, 2026年6月.
  2. 系列整合性評価に特化した高難度日本語テキスト音声合成コーパスの検討
    今井柊平, 榎本悠久, 金子剛士, 中村泰貴
    日本音響学会秋季研究発表会, 2025年. PaperHugging FaceGitHub
  3. TTSモデルのマージ・タスク算術を用いた追加学習なしのモデル操作の検討
    榎本悠久, 今井柊平, 中村泰貴, 金子剛士
    日本音響学会秋季研究発表会, 2025年.
  4. ニューラルボコーダによる擬似ささやき声の生成に関する検討
    今井柊平, 能勢隆, 伊藤彰則
    日本音響学会春季研究発表会, pp. 895-896, 2023年.
  5. Tachylone: サイクル一貫学習に基づくニューラルボコーダの話者適応による低遅延リアルタイム声質変換
    今井柊平, 金垣葵, 能勢隆, 府川省吾, 伊藤彰則
    日本音響学会春季研究発表会, pp. 835-838, 2023年.
  6. CycleGANに基づく音声・歌声の同時変換に関する検討
    府川省吾, 能勢隆, 今井柊平, 伊藤彰則
    日本音響学会春季研究発表会, pp. 791-794, 2023年.
  7. 深層学習に基づく歌声合成における歌唱表現のモデル化の分析
    高谷恒輝, 能勢隆, 今井柊平, 伊藤彰則
    日本音響学会秋季研究発表会, pp. 1391-1394, 2022年.
  8. 日本語テキスト音声合成のためのアクセント情報を考慮した単語埋め込み手法の評価
    井上真揮, 能勢隆, 遠藤真裕, 今井柊平, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 19-24, 2022年.
  9. 非自己回帰型End-to-End音声合成のためのモノトニックアラインメントに関する検討
    遠藤真裕, 能勢隆, 今井柊平, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 25-30, 2022年.
  10. Sinsyにおける歌唱スタイルのモデル化の検証
    高谷恒輝, 能勢隆, 今井柊平, 高野陽央, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 31-36, 2022年.
  11. 音素ポステリオグラムに基づくノンパラレル声質変換の性能分析
    藤原知樹, 能勢隆, 金垣葵, 今井柊平, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 37-42, 2022年.
  12. pix2pixを用いた顔特徴点系列からのフォトリアリスティックトーキングヘッド生成の検討
    高野陽央, 能勢隆, 今井柊平, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 43-48, 2022年.
  13. 時間情報ラベルを必要としない非自己回帰型TTSモデルの学習法の検討
    遠藤真裕, 能勢隆, 今井柊平, 伊藤彰則
    東北地区音響学研究会, 2021年.
  14. 韻律を考慮したスペクトルモデリングに基づく高速・軽量なニューラル音声合成
    遠藤真裕, 能勢隆, 今井柊平, 金垣葵, 伊藤彰則
    東北地区若手研究者研究発表会, pp. 33-34, 2021年.
  15. 多数話者健常音声を用いたCycleGANに基づく構音障害音声の明瞭性改善
    今井柊平, 能勢隆, 金垣葵, 渡辺聡, 伊藤彰則
    日本音響学会秋季研究発表会, pp. 931-934, 2020年.
  16. CycleGANに基づく構音障害音声の明瞭性改善
    今井柊平, 能勢隆, 金垣葵, 渡辺聡, 伊藤彰則
    電子情報通信学会 福祉情報工学研究会 (WIT), 信学技報, vol. 120, no. 63, pp. 1-6, 2020年.

Experience

  • Apr – Jul 2023 (3 months)
    Toshiba Cambridge Research Laboratory
    Research Intern
    Research on improving English speech recognition with diverse accents via data augmentation based on text-to-speech synthesis
  • Feb 2018 (1 month)
    Fixstars Corporation
    Intern
    Authored articles on quantum annealing technology

Awards & Scholarships

Awards

Scholarships