今井 柊平

今井 柊平(Nuts)

Shuhei Imai

Parakeet株式会社で音声合成技術に関する研究開発を行っています。 ご興味のある方はXのDMまたはメールにてお気軽にご連絡ください。

Education

  • 2022年4月 – 現在
    東北大学 大学院工学研究科 通信工学専攻 (大町)・能勢研究室
    博士課程(休学中)
  • 2021年4月 – 現在
  • 2020年4月 – 2022年3月
    東北大学 大学院工学研究科 通信工学専攻 伊藤・能勢研究室
    修士課程
  • 2016年4月 – 2019年9月
    東北大学 工学部 電気情報物理工学科
    学士(3.5年早期卒業者)
  • 2013年4月 – 2016年3月
    新潟県立国際情報高等学校 情報科学科

Research Interests

  • Speech Generation
    Text-to-Speech, Voice Conversion, Singing Voice Synthesis, Neural Vocoder
  • Speech Representation Learning
    Audio Codecs, Self-Supervised Speech Models, Latent Speech Modeling
  • Speech and Language Modeling
    Autoregressive Models, Multimodal Generation, Omni-modal LLM
  • Robust Speech Processing
    Automatic Speech Recognition, Speech Enhancement, Speech Restoration
  • Generative Modeling
    GANs, Diffusion Models, Flow Matching
  • Signal Processing
    Digital Signal Processing, Acoustic Modeling, Spectral Analysis

Publications

ジャーナル

  1. Fast end-to-end non-parallel voice conversion based on speaker-adaptive neural vocoder with cycle-consistent learning
    Shuhei Imai, Aoi Kanagaki, Takashi Nose, Shogo Fukawa, Akinori Ito
    Acoustical Science and Technology, Vol. 46, No. 1, pp. 116–119, 2025. Paper
  2. Unified model for voice conversion of speech and singing voice using adaptive pitch constraints
    Shogo Fukawa, Takashi Nose, Shuhei Imai, Akinori Ito
    Acoustical Science and Technology, Vol. 46, No. 1, pp. 120–123, 2025. Paper

査読付き国際会議

  1. Improving accented speech recognition using data augmentation based on unsupervised text-to-speech synthesis
    Cong-Thanh Do, Shuhei Imai, Rama Doddipatla, Thomas Hain
    Proc. EUSIPCO, pp. 136–140, 2024. arXiv
  2. Improving Pronunciation Clarity of Dysarthric Speech Using CycleGAN with Multiple Speakers
    Shuhei Imai, Takashi Nose, Aoi Kanagaki, Satoshi Watanabe, Akinori Ito
    Proc. GCCE, pp. 488–489, 2020.

全国大会・研究会

  1. Human Fooling Rateテストに基づく最先端の日本語テキスト音声合成モデルの評価および分析
    齋藤佑樹, Wen-Chin Huang, 榎本悠久, 今井柊平
    情報処理学会研究報告, 2026-SLP-160, 5 pages, 2026年6月.
  2. 系列整合性評価に特化した高難度日本語テキスト音声合成コーパスの検討
    今井柊平, 榎本悠久, 金子剛士, 中村泰貴
    日本音響学会秋季研究発表会, 2025年. PaperHugging FaceGitHub
  3. TTSモデルのマージ・タスク算術を用いた追加学習なしのモデル操作の検討
    榎本悠久, 今井柊平, 中村泰貴, 金子剛士
    日本音響学会秋季研究発表会, 2025年.
  4. ニューラルボコーダによる擬似ささやき声の生成に関する検討
    今井柊平, 能勢隆, 伊藤彰則
    日本音響学会春季研究発表会, pp. 895-896, 2023年.
  5. Tachylone: サイクル一貫学習に基づくニューラルボコーダの話者適応による低遅延リアルタイム声質変換
    今井柊平, 金垣葵, 能勢隆, 府川省吾, 伊藤彰則
    日本音響学会春季研究発表会, pp. 835-838, 2023年.
  6. CycleGANに基づく音声・歌声の同時変換に関する検討
    府川省吾, 能勢隆, 今井柊平, 伊藤彰則
    日本音響学会春季研究発表会, pp. 791-794, 2023年.
  7. 深層学習に基づく歌声合成における歌唱表現のモデル化の分析
    高谷恒輝, 能勢隆, 今井柊平, 伊藤彰則
    日本音響学会秋季研究発表会, pp. 1391-1394, 2022年.
  8. 日本語テキスト音声合成のためのアクセント情報を考慮した単語埋め込み手法の評価
    井上真揮, 能勢隆, 遠藤真裕, 今井柊平, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 19-24, 2022年.
  9. 非自己回帰型End-to-End音声合成のためのモノトニックアラインメントに関する検討
    遠藤真裕, 能勢隆, 今井柊平, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 25-30, 2022年.
  10. Sinsyにおける歌唱スタイルのモデル化の検証
    高谷恒輝, 能勢隆, 今井柊平, 高野陽央, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 31-36, 2022年.
  11. 音素ポステリオグラムに基づくノンパラレル声質変換の性能分析
    藤原知樹, 能勢隆, 金垣葵, 今井柊平, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 37-42, 2022年.
  12. pix2pixを用いた顔特徴点系列からのフォトリアリスティックトーキングヘッド生成の検討
    高野陽央, 能勢隆, 今井柊平, 伊藤彰則
    日本音響学会音声研究会, Vol. 2, No. 1, pp. 43-48, 2022年.
  13. 時間情報ラベルを必要としない非自己回帰型TTSモデルの学習法の検討
    遠藤真裕, 能勢隆, 今井柊平, 伊藤彰則
    東北地区音響学研究会, 2021年.
  14. 韻律を考慮したスペクトルモデリングに基づく高速・軽量なニューラル音声合成
    遠藤真裕, 能勢隆, 今井柊平, 金垣葵, 伊藤彰則
    東北地区若手研究者研究発表会, pp. 33-34, 2021年.
  15. 多数話者健常音声を用いたCycleGANに基づく構音障害音声の明瞭性改善
    今井柊平, 能勢隆, 金垣葵, 渡辺聡, 伊藤彰則
    日本音響学会秋季研究発表会, pp. 931-934, 2020年.
  16. CycleGANに基づく構音障害音声の明瞭性改善
    今井柊平, 能勢隆, 金垣葵, 渡辺聡, 伊藤彰則
    電子情報通信学会 福祉情報工学研究会 (WIT), 信学技報, vol. 120, no. 63, pp. 1-6, 2020年.

Experience

  • 2023年4月 – 7月(3ヶ月)
    東芝ケンブリッジ研究所
    リサーチインターン
    テキスト音声合成を用いたデータ拡張による、多様なアクセントを含む英語音声の認識性能改善に関する研究
  • 2018年2月(1ヶ月)
    株式会社フィックスターズ
    インターン
    量子アニーリング技術に関する記事執筆等

Awards & Scholarships

Awards

Scholarships