録音された音楽から音符を取り出す「自動耳コピ」は、コンピュータと音楽の世界で昔から追い求められてきたテーマです。そうした中、物理学の研究者からプログラマーに転じた市來健吾(いちき けんご)さんが1996年に書き始め、GPLのオープンソースとして公開してきた採譜プログラム「WaoN」が、iPhone/iPad/Mac用のネイティブアプリ「わおん — Music Transcriber」として生まれ変わりました。波形、スペクトログラム、検出されたノートを1つのタイムラインに並べて表示し、手で修正した上でMIDIやMusicXMLに書き出すことが可能です。さらに再生速度を0倍にしても音が鳴り続けるという、ユニークな再生機能も備えています。
価格は無料で、どの音源でも最初の30秒は解析・編集・書き出しまですべての機能が利用可能。アプリ内課金のFull Unlock(4,980円、買い切り)を購入すると長さの制限がなくなり、iPhone/iPad/Macのすべてで使えるようになります。実際どんなアプリなのか紹介するとともに、開発者である市來さんにオンラインで話を伺ったので、WaoN誕生の経緯や、位相情報を使った独自の解析技術、そしてAIによる採譜が急速に進化する中でこのアプリをリリースした思いなどについても紹介していきます。
録音の中の音符を「見る」アプリ、わおん
わおんは、音楽ファイルやマイクで録音した音を解析し、そこに含まれる音符を検出するアプリです。開くことができるのはMP3、AAC/M4A、WAV、AIFFなど、端末で再生できるオーディオファイル。また、その場でマイク録音した音を解析することもできます。
大きな特徴は、解析が端末内ですべて完結する点です。音源をサーバーにアップロードすることはなく、アカウント登録も不要。広告も表示されません。DTMステーションでもさまざまな採譜ツールを紹介してきましたが、最近はクラウド上で処理するタイプが増えている中、手元のデバイスだけで処理するので、音源を外部に出したくない場合でも安心して使えます。
対応環境はiOS/iPadOS 16.0以降、macOS 14.0以降。ユニバーサル購入に対応しているため、一度購入すれば同じApple アカウントのiPhone、iPad、Macのすべてで利用できます。なお、アプリのUIは英語ですが、操作は比較的シンプルなので、迷うことはあまりないと思います。
波形、スペクトログラム、ノートを1つのタイムラインに表示
音源を読み込むと、画面上部に波形、下部にスペクトログラムが表示され、その上に検出されたノートがオレンジ色のバーで重ねて描かれます。スペクトログラムの左側にはピアノの鍵盤が表示されるので、どのノートがどの音程なのかがひと目でわかります。表示はスペクトル、重ね表示、ノートのみを切り替えることができ、拡大・縮小や頭出しも自在です。
私も手元の曲をいくつか読み込んで試してみましたが、既存の自動採譜ソフトと比較しても、かなりいい精度で音を拾ってくれる印象です。とくに注目したいのは、これまでの採譜ソフトが苦手としてきた低音域のノートをしっかり捉えている点。これは後ほどのインタビューで詳しく紹介する、フェイズボコーダーの技術を応用した周波数補正によるもので、FFTの分解能そのものより細かく音程を決定できるのがわおんの強みとなっています。
また、Full Unlock後は扱える音源の長さに上限がありません。タイムラインは音源のフレーム番号で管理され、作業している範囲だけをファイルから読み込んで解析する構造になっているため、端末のストレージに空きがある限り、1時間の音源でも普段どおりに扱えるとのことです。
自動採譜は「答え」ではなく「出発点」。ノートを手で直せる編集機能
自動採譜はどんなに精度が上がっても、倍音を音として拾ってしまったり、逆に聴こえているはずの音を取りこぼしたりすることがあります。そこでわおんでは、自動採譜を「最終回答」ではなく「編集の出発点」として捉え、検出されたノートを手で修正できるようにしています。
具体的には、ノートを1つずつ選択してその音だけを鳴らしたり、時間方向や音程方向にドラッグして移動したりすることが可能。拾えなかった音を追加し、拾いすぎた音を削除することもできます。ドラッグでは追い込みきれない場合には、ノート・インスペクタを使って音程、開始位置、終了位置、ベロシティを数値で微調整できます。もちろんアンドゥ、リドゥにも対応しています。
こうして修正したデータは、MIDIまたはMusicXMLで書き出すことが可能です。書き出し前には調とテンポが自動推定され、推定が外れていれば手で直すこともできます。ファイルとして保存するほか、ほかの音楽アプリへ直接送ることもできるので、DAWに読み込んでアレンジの素材にしたり、楽譜作成ソフトで譜面に仕上げたりといった使い方ができます。
なお、わおんは「セッション指向」のアプリとして設計されています。一度に扱うのは1つの録音で、アプリが作業データのライブラリを管理することはありません。残したいものはユーザー自身がMIDIやMusicXMLで書き出して保存する、という割り切った思想になっています。
0倍速でも音が止まらない。耳コピや練習に効く再生機能
わおんのもう1つの大きな特徴が、再生機能です。原音と検出したノートの音を聴き比べたり、難しい箇所にループを設定して繰り返し聴いたりできるのはもちろん、再生速度とピッチを、元の音を変えずに個別に変更することができます。
再生速度は−2倍から+2倍まで1つのつまみで連続的に変化し、マイナスにすると逆再生になります。そして驚くのは、0倍、つまり停止状態にしても音が止まらないこと。再生位置のスペクトルを合成し続けるので、和音がその場で鳴ったままになるのです。耳コピをしていると、和音の内声を確認するために何度も同じ箇所を再生し直すことになりますが、わおんなら気になる瞬間で止めて、じっくり聴くことができます。
Appleの標準のオーディオライブラリでは速度を0にすることができないため、ここにはオープンソース版WaoNに含まれる市來さん自身のフェイズボコーダー「pv」の実装を組み込んでいるとのこと。もちろん半音単位で音程を変えることもできるので、自分の楽器のキーに合わせて練習する、といった用途にも便利です。
無料で全機能を試せ、Full Unlockは買い切り4,980円
前述のとおり、わおんは無料でダウンロードでき、どの音源でも最初の30秒であれば、解析、編集、書き出しまですべての機能を利用できます。購入によって解放されるのは長さの制限のみで、機能が隠されているわけではありません。アプリ内課金のFull Unlockは4,980円の買い切りで、サブスクリプションではありません。
市來さん自身が、Mac版を使って解析からノートの編集、MIDI/MusicXMLへの書き出しまでを実際に操作しながら日本語で解説している、約9分のビデオも公開されているので、ぜひご覧ください。
開発者の市來健吾さんによる、わおんの使い方の実演(Mac版)
まずは、自分の耳で一度コピーしたことのある曲の最初の30秒を読み込んでみて、わおんがどこまで音を見つけてくれるのかを試してみるのがよさそうです。
開発者・市來健吾さんに聞く、WaoNの30年とAI時代の自動採譜
ここからは、わおんを開発した市來健吾さんへのインタビューです。
ーーまずは市來さんの本業から教えていただけますか?
市來:直近の15年ほどは、プログラマーとして仕事をしてきました。その前は研究者で、物理の分野でコンピュータシミュレーションを主に使う世界にいました。博士課程まで進み、そのまま大学などの研究所で10年くらい研究をしていたんです。アカデミアでのキャリアにいったん区切りをつけたとき、プログラミングができたので、結果的にプログラマーになったという流れです。
ーーお仕事のテーマは音楽ではなかったのですね。
市來:仕事のほうは研究開発的な部分で、ターゲットは画像処理などが中心でした。ここ7年ぐらいはAIが盛り上がってきたこともあり、早いうちからAIの研究開発にも携わっています。
ーーでは、WaoNはそうしたお仕事とは別のところから生まれたものなんですね。
市來:キャリアよりずっと前、大学に入った直後くらいの話です。もともと音楽が好きで、子どものころピアノを少しだけ習ったのですが、すぐにやめてしまって。それでも音楽は好きで、とくにコード、ハーモニーがすごく素敵だなと思うのに、聴いても自分ではなかなか取れない。それが子どものころからずっとモチベーションとしてありました。一方でコンピュータは小学生のころから家にあったので、コーディングにはずっと親しんでいたんです。大学に入って数学を学ぶと、周波数さえ取れればいいという話なので、プログラムでメロディだけでなくハーモニー、つまり複数の音を取れるはずだろうと始めたのがきっかけです。
ーー小学生のころのコンピュータというのは何だったんですか?
市來:父親がいきなり買ってきた、シャープのMZ-80Bです。それを買う前も電気屋さんの展示機で、小学生がキーボードを独占してBASICでプログラムを書き換えたりしていました(笑)。大学に入ったころはもうPC-98の世界で、ローランドの音源と組み合わせてDTMにハマったという世代ですね。
ーーMZ-80Bが出たのが、ちょうど私が高校1年生のときでした。当時はシャープ派とNEC派に分かれていて、私はPC-8001でプログラミングしていましたね。WaoNを最初に公開したのはいつごろですか?
市來:最初にSourceForgeで公開したのが97年ごろだったと思います。初期のバージョンは、FFTをかけただけのようなものでした。
ーーそんなに昔なんですね。もう30年近くになるわけですね。
市來:そうなんです。自分でもびっくりしますが、ずっと連続して開発していたわけではなく、ときどきふと思いついて触る、ということが30年の間に2、3回あった感じです。
位相情報を使って低音の音程を補正する
ーーFFTを使えば、どの周波数にピークが立っているのかは大昔から解析できました。でも、すべてがサイン波でできている音楽ならともかく、実際にはいろいろな音が混ざっていて、あちこちにピークが出てくるため、どれが本当のノートなのかわからない。基本周波数を特定するのがものすごく難しく、結果としてあまり使いものにならない……というのが、これまでの自動採譜だったと思います。WaoNはどうやってここまで来たのでしょうか?
市來:おっしゃるとおりで、手垢のついた古い技術なんです。スペクトルを見てピークが立っているのは倍音ですし、楽器や声によってフォルマントや倍音の出方も違う。倍音をどれぐらい除くのかは、かなり恣意的、人為的なアルゴリズムだと思います。そこは試行錯誤しながら倍音を消していき、低いほうからピークを取っていくというのがベースです。それ以上のところは、プログラムに与えるパラメータを可変にしておいて、オープンソースなので、あとはみんな頑張ってね、というスタンスでした(笑)。
ーーその中で、大きなブレイクスルーになったのは?
市來:フェイズボコーダー、つまり位相の情報を使ったことです。FFTは周波数をリニアに刻んでいるので、高音と低音でスケールがまったく違うんです。低音域では1つのビンの幅が相対的に大きくなってしまい、音楽は半音単位で取りたいのに、3音くらいが1つのビンに入ってしまうような状況で、手も足も出ない。ところが位相を使った補正をすると、本当の周波数がビンの中心からどれくらいずれているかを数値として出せるんです。これで補正すると、ベースのように和音ではなく1音でウロウロしているところが、かなり正しく補正されるんですよ。これは経験的にも、1つのブレイクスルーだったと思っています。
ーーそもそも、なぜ位相に着目したのですか?
市來:FFTは可逆変換なのに、パワースペクトルでは半分の情報しか使っていないのはおかしいよな、とずっと思っていたんです。捨てている位相の部分も使えるじゃん、というのが面白いなと。フェイズボコーダー自体にも興味があって実装していたので、そのアイデアを周波数の補正に使えると思ったわけです。教科書にはあまりあからさまに書かれていない話だと思います。WaoNに組み込んだのは2007年ごろだったと記憶していますが、アイデア自体は2000年ごろからありました。
※補足:たとえばサンプリングレート44.1kHzの音を4,096ポイントでFFTすると、1つのビン(周波数の区切り)の幅は約10.8Hzになります。一方、ベースの音域であるA1(55Hz)とその半音上のA#1との差はわずか約3.3Hz。つまり低音域では、1つのビンの中に3つ以上の半音が収まってしまうわけです。フェイズボコーダーの手法では、連続するフレーム間での位相の変化量から、ビン中心とのずれを計算して本当の周波数を推定します。
AIの力を借りて、約1週間でiOSアプリに
ーーこれまで30年近くオープンソースとして発展させてきて、製品化しようとは考えていなかったんですか?
市來:むしろどちらかというと、プロプライエタリに対する敵意を持っているタイプの学者上がりですから(笑)。プログラムは公共のものだという価値観で生きてきたので、GPLで公開してきました。ただ、WaoNは私1人で書いてきたプログラムなので、デュアルライセンスにすればいい話だな、とは思っていたんです。そんな中、直近の半年ほど仕事でコーディングAIを使っていて、その威力を実感していました。iOSアプリは仕事で少し書いたことがある程度で、フロントエンドをガチガチに書くエンジニアではないのですが、WaoNのアルゴリズムをスマホで使えたらいいなとずっと思っていたんです。そこでAIと協力しながら書いてみたら、iOSでラッパーをかぶせるところまでは1週間くらいであっさりできてしまった。これはすごいと思って、iOSアプリなら売り物にしよう、と。
ーーコアの部分は、オープンソース版のWaoNと同じなのですか?
市來:本質的な部分は同じです。FFTベースで、フェイズボコーダーによる補正で周波数の解像度を上げたバージョンでノートをピックアップしています。その結果をさらに一段階フィルタリングするといった処理を、AIの提案に従って加えているので完全に同じではありませんが、コアのアルゴリズムは同じですね。一方、見た目や操作性はまったく違います。MIDIファイルで出力するなら簡単な編集はできたほうがいいと思って編集機能も入れましたが、オープンソース版ではそのあたりのGUIプログラミングは手に負えないと思っていた部分です。またMacでもビルドできたので、Mac版も用意しました。画面が広くマウスが使えると、また全然違う感覚で使えますよ。
ーー採譜エンジンそのものに、AIは使っていないのでしょうか?
市來:私のプロジェクトでは使っていません。
なお、市來さんがQiitaに書いた記事によると、解析部分はC言語のまま、GUIはSwiftで全面的に書き直す形で開発したとのことです。オリジナルのWaoN(コマンドライン版のwaon、フェイズボコーダーのpv、GUI版のgWaoN)は、これまでどおりGPLのままGitHubで公開が続けられています。
AIによる採譜の圧倒的な進化を、開発者はどう見ているのか
ーー一方で、最近はAIによる採譜やステム分離が急速に進化しています。市來さんもそのあたりについて書かれていましたよね。
市來:2018年にQiitaで、当時出始めだったGoogleのAI採譜モデル(Magenta)と自分のWaoNを同じ素材で比較する記事を書きました。2020年に初めて書いた技術同人誌でも、長くやってきたこのプロジェクトをネタにしています。その当時は、ひいき目はあるものの、互角ぐらいに戦えている感覚でした。その後、AI技術はどんどん進んでいて、今回アプリを出したタイミングで、その記事の続編を書こうと思ったんです。そこで試したのが、フランスのkyutaiというAI研究所が出しているMuScriptorという採譜に特化したモデルです。これが、すごくよかった。混ざった音源を楽器ごとのステムに分割するのは採譜の大きな悩みどころでしたが、そこもAIがやってくれる。私が好きなジャズのシンプルなトリオぐらいの編成の曲をかけてみたら、私が欲しい情報は完璧に取れていました。採譜という分野で私のアプリを宣伝したり売ったりするのは、実態としてはもう負けたな、という感覚です。作っておいてなんですが(笑)。
ーーFFTの延長線上にあるDSPのアルゴリズムによる採譜を、AIが上回ってきたと。
市來:それは否定できないし、世間的にも明らかですよね。技術の進歩は圧倒的です。
ーーそうした中で、わおんを今リリースする意義はどこにあると考えていますか?
市來:こじつけかもしれませんが、フェイズボコーダーはそもそも何のために開発された技術かというと、音程をキープしたまま再生スピードを変えるためのもの。今ではYouTubeにも普通に入っているので、みんな背後にある技術を気にしていないと思いますが、それがフェイズボコーダーなんです。カラオケマシンのように、実際の音源の音程を変えることもできます。WaoNはもともと、自分が楽器を弾くときの耳コピを助けるツールを志向していたので、ゆっくり再生して詳しく聴きたい、といった機能を今回のアプリにも入れています。AppleのライブラリではスピードをゼロにできないのでWaoNの自前のフェイズボコーダーを組み込み、一時停止しても音が鳴り続けるようにしたり、逆再生できるようにしたりしました。採譜能力ではAIに負けてしまったけれど、練習ツールとして喜んでもらえる部分はあるのかなというのが、今の私の心持ちですね。
ーーなるほど。
市來:そもそも私が古き良きDSP的な耳コピにこだわってきたのは、結果が欲しいだけではなく、その結果を自分の頭で理解したいという思いがあったからなんです。AIはブラックボックスで、結果だけですからね。そういう意味でのこだわりでもあったので、これでいいのかなと思っています。
ーー今回、DTMステーションにご連絡いただいたのも、AIがきっかけだったそうですね。
市來:プロモーション先として、最初は海外のプラグイン情報サイトのKVR Audioを、次に日本国内ならDTMステーションだとAIが提案してくれて、背中を押された感じです(笑)。それにしても、AIがなかったらiOSアプリにしようとは思わなかったので、新しいことにトライするハードルを下げてくれていますね。面白い世の中になったと思います。
技術の背景は書籍『音楽と数理 才能にたよらない耳コピ』で解説
インタビューの中でも触れていた技術同人誌が、『音楽と数理 才能にたよらない耳コピ』です。音と音程の基本から始まり、フーリエ解析、離散フーリエ変換、パワースペクトル、窓関数、そしてフェイズボコーダーによる周波数補正までを順にたどりながら、WaoNがどのようにしてオーディオをMIDIに変換しているのかを解説しています。専門家向けではなく、好奇心のあるアマチュアに向けて書かれた本で、わおんのスペクトログラムがなぜあのような形に見えるのかを理解するうえでも役立ちそうです。また、英語版の『Listen Like a Programmer』もKindleで発売されています。
AIによる採譜がブラックボックスとして驚くような結果を出す時代だからこそ、自分の耳と頭で音楽を理解したい人にとって、仕組みが見えるわおんと、その背景を解説したこの本の組み合わせは、ほかにはない魅力を持っているのではないでしょうか。
【製品情報】
製品名:わおん — Music Transcriber
開発:灰泥屋(市來健吾)
バージョン:1.1.4(2026年9月22日公開)
対応OS:iOS/iPadOS 16.0以降、macOS 14.0以降
表示言語:英語
価格:無料(各音源の最初の30秒まで全機能利用可能)、Full Unlock 4,980円(買い切り、iPhone/iPad/Mac共通のユニバーサル購入)
App Store:https://apps.apple.com/app/id6795827431
日本語紹介ページ:https://haidoroya.com/ja/waon/
オープンソース版WaoN(GPL):https://github.com/kichiki/WaoN
【関連書籍】
音楽と数理 才能にたよらない耳コピ(市來健吾 著)










コメント