今井 柊平(Nuts)
Shuhei Imai
- Chief Research Officer (CRO) Parakeet Inc.
- 博士課程3年(休学中) 東北大学 (大町)・能勢研究室
Parakeet株式会社で音声合成技術に関する研究開発を行っています。 ご興味のある方はXのDMまたはメールにてお気軽にご連絡ください。
Education
- 2022年4月 – 現在東北大学 大学院工学研究科 通信工学専攻 (大町)・能勢研究室博士課程(休学中)
- 2021年4月 – 現在
- 2020年4月 – 2022年3月東北大学 大学院工学研究科 通信工学専攻 伊藤・能勢研究室修士課程
- 2016年4月 – 2019年9月東北大学 工学部 電気情報物理工学科学士(3.5年早期卒業者)
- 2013年4月 – 2016年3月新潟県立国際情報高等学校 情報科学科
Research Interests
- Speech GenerationText-to-Speech, Voice Conversion, Singing Voice Synthesis, Neural Vocoder
- Speech Representation LearningAudio Codecs, Self-Supervised Speech Models, Latent Speech Modeling
- Speech and Language ModelingAutoregressive Models, Multimodal Generation, Omni-modal LLM
- Robust Speech ProcessingAutomatic Speech Recognition, Speech Enhancement, Speech Restoration
- Generative ModelingGANs, Diffusion Models, Flow Matching
- Signal ProcessingDigital Signal Processing, Acoustic Modeling, Spectral Analysis
Publications
ジャーナル
- Fast end-to-end non-parallel voice conversion based on speaker-adaptive neural vocoder with cycle-consistent learningAcoustical Science and Technology, Vol. 46, No. 1, pp. 116–119, 2025. Paper
- Unified model for voice conversion of speech and singing voice using adaptive pitch constraintsAcoustical Science and Technology, Vol. 46, No. 1, pp. 120–123, 2025. Paper
査読付き国際会議
- Improving accented speech recognition using data augmentation based on unsupervised text-to-speech synthesisProc. EUSIPCO, pp. 136–140, 2024. arXiv
- Improving Pronunciation Clarity of Dysarthric Speech Using CycleGAN with Multiple SpeakersProc. GCCE, pp. 488–489, 2020.
全国大会・研究会
- Human Fooling Rateテストに基づく最先端の日本語テキスト音声合成モデルの評価および分析情報処理学会研究報告, 2026-SLP-160, 5 pages, 2026年6月.
- 系列整合性評価に特化した高難度日本語テキスト音声合成コーパスの検討日本音響学会秋季研究発表会, 2025年. PaperHugging FaceGitHub
- TTSモデルのマージ・タスク算術を用いた追加学習なしのモデル操作の検討日本音響学会秋季研究発表会, 2025年.
- ニューラルボコーダによる擬似ささやき声の生成に関する検討日本音響学会春季研究発表会, pp. 895-896, 2023年.
- Tachylone: サイクル一貫学習に基づくニューラルボコーダの話者適応による低遅延リアルタイム声質変換日本音響学会春季研究発表会, pp. 835-838, 2023年.
- CycleGANに基づく音声・歌声の同時変換に関する検討日本音響学会春季研究発表会, pp. 791-794, 2023年.
- 深層学習に基づく歌声合成における歌唱表現のモデル化の分析日本音響学会秋季研究発表会, pp. 1391-1394, 2022年.
- 日本語テキスト音声合成のためのアクセント情報を考慮した単語埋め込み手法の評価日本音響学会音声研究会, Vol. 2, No. 1, pp. 19-24, 2022年.
- 非自己回帰型End-to-End音声合成のためのモノトニックアラインメントに関する検討日本音響学会音声研究会, Vol. 2, No. 1, pp. 25-30, 2022年.
- Sinsyにおける歌唱スタイルのモデル化の検証日本音響学会音声研究会, Vol. 2, No. 1, pp. 31-36, 2022年.
- 音素ポステリオグラムに基づくノンパラレル声質変換の性能分析日本音響学会音声研究会, Vol. 2, No. 1, pp. 37-42, 2022年.
- pix2pixを用いた顔特徴点系列からのフォトリアリスティックトーキングヘッド生成の検討日本音響学会音声研究会, Vol. 2, No. 1, pp. 43-48, 2022年.
- 時間情報ラベルを必要としない非自己回帰型TTSモデルの学習法の検討東北地区音響学研究会, 2021年.
- 韻律を考慮したスペクトルモデリングに基づく高速・軽量なニューラル音声合成東北地区若手研究者研究発表会, pp. 33-34, 2021年.
- 多数話者健常音声を用いたCycleGANに基づく構音障害音声の明瞭性改善日本音響学会秋季研究発表会, pp. 931-934, 2020年.
- CycleGANに基づく構音障害音声の明瞭性改善電子情報通信学会 福祉情報工学研究会 (WIT), 信学技報, vol. 120, no. 63, pp. 1-6, 2020年.
Experience
- 2023年4月 – 7月(3ヶ月)東芝ケンブリッジ研究所リサーチインターンテキスト音声合成を用いたデータ拡張による、多様なアクセントを含む英語音声の認識性能改善に関する研究
- 2018年2月(1ヶ月)株式会社フィックスターズインターン量子アニーリング技術に関する記事執筆等
Awards & Scholarships
Awards
- 2023 学生優秀発表賞 — 日本音響学会2023年春季研究発表会
Scholarships
- 2022年4月 – 2022年9月 東北大学高等大学院博士後期課程学生挑戦的研究支援プロジェクト
- 2021年4月 – 2022年9月 東北大学 人工知能エレクトロニクス卓越大学院プログラム
- 2020年4月 – 2022年3月 公益信託 岩井久雄記念宮城奨学育英基金 — 給付奨学生
- 2018年4月 – 2019年9月 公益信託 岩井久雄記念宮城奨学育英基金 — 給付奨学生