手元のiPhoneを、Macで動かすローカルAIの「助っ人」にするツールが登場しました。開発者StayLameBro氏がGitHubで公開した「Backburner」は、USB-CケーブルでつないだiPhoneの画像処理能力(GPU)やNeural Engineを使い、Mac単体より長く・速くローカルで大きなAIモデルを扱えるようにする試みです。クラウドにデータを預けずに社内資料をAIに読ませたいビジネスパーソンにとって、「余っているスマホを計算の手伝い役にできる」という発想は新鮮です。この記事では、公式のREADMEと信頼できる報道をもとに、何が速くなるのか・何が必要か・どこまで実用的かをわかりやすく整理します。
Backburnerとは何か——iPhoneを「外付けの計算ブースター」にする
Backburnerは、Apple Silicon搭載のMacとiPhoneを10ギガビット毎秒対応のUSB-Cケーブルでつなぎ、いわば「外付けの計算ブースター」としてiPhoneを使うオープンソースのツールです。たとえるなら、オフィスのメインPC(Mac)が大きな資料を読み込むとき、隣の空きデスクにいる同僚(iPhone)に後半の作業を分担してもらうような仕組みです。ゲーム機に外付けGPUをつなぐイメージに近い、とPC Watchも紹介しています。
中身は、ローカルで大規模言語モデルを動かす定番ソフト「llama.cpp」の派生版(フォーク)に、Mac向け・iPhone向けの独自の高速化処理を足したものです。Mac側はサーバーとして動き、iPhone側には専用アプリを入れます。チャット画面そのものは付いておらず、OpenAI互換のAPI(住所のような接続先)をパソコン上で開くタイプです。ライセンスはMIT、執筆時点ではプレリリース(試作公開)で、GitHub上のリリースはv0.0.1〜v0.0.4(2026年10月3日公開)が並んでいます。リポジトリ自体は2026年10月1日に作成されています。
何が速くなるのか——「資料を読む待ち時間」が短くなる
AIが長い指示やファイルを最初に読み込む工程を、専門用語では「プレフィル(prefill)」と呼びます。ビジネスの感覚では、「部下に厚い企画書を渡して、読み終わるまで待つ時間」に近いものです。Backburnerが主に短縮するのは、この待ち時間です。
公式READMEによると、会話の流れ(コンテキスト)がおよそ64kトークンまでのとき、入力を256トークンずつの塊に分け、Macがモデルの第1〜40層、iPhoneが第41〜64層を担当し、ケーブル越しに中間結果をつないで並行処理します。開発者が2026年10月1日に測定した数値(Qwen3.8-27BのIQ4_XS形式、MacBook Pro M4 Pro 24GB、iPhone 17 Pro Max、USB-C接続)では、すでにセッションに残っている文脈が16k/32k/48kのときに、約2,000トークンの追加読み込みが次のように変わりました。
- 16k:Mac単体 109トークン/秒(18.8秒)→ iPhone追加 157トークン/秒(13.1秒)=約44%速く、待ち時間は約31%減
- 32k:101トークン/秒(20.3秒)→ 130トークン/秒(15.8秒)=約29%速く
- 48k:87トークン/秒(23.5秒)→ 113トークン/秒(18.1秒)=約30%速く
重要な注意点があります。ここでいう「最大約44%高速化」は、回答を書き出す速度ではなく、入力を読み込む速度の話です。同じ測定では、27k〜33k文脈での回答生成は、通常のllama.cppが11.3トークン/秒、BackburnerのMac単体が25.0、iPhone追加が25.1とほぼ同じでした。つまり「答えが流れるように速く出る」効果は、主にMac側の最適化(SME2や投機的デコーディング「DFlash2」など)によるもので、iPhoneを足した効果は別物です。また、約512トークン未満の短い入力ではiPhoneはほぼ参加しません。開発者が使った実セッションでは、36件の要求のうち参加したのは7件でしたが、その7件が読み込んだトークン全体の約83%を占めていた、とREADMEに書かれています。
長い会話メモをiPhoneに預ける——「机の引き出し」を増やす
ローカルAIでは、会話や資料の履歴を一時的に覚えておく「作業メモ」がメモリを食います。公式READMEでは、24GBのMac単体だと8ビットの文脈で実測64kトークンが上限(128kは4ビットに落とさないと載りにくい)とあります。Backburnerは、古いメモの一部をiPhone側のメモリに移し、必要なときの参照計算もiPhoneのGPU(さらに回答生成時はNeural Engineの一部)に任せることで、作業机の引き出しを増やす発想です。
iPhone 17 Pro Maxでは、起動時の空きメモリに応じて196k〜229kトークン(8ビット)まで見積もれるとされ、端から端までの通し確認は128k(8ビット)および140k(4ビット)まで行われたとREADMEにあります。PC Watchも、24GB Macで128kトークンを保持できるようになる、と報じています。「同じ答えになるか」についても、貪欲法での出力がiPhoneあり/なしでトークン単位で一致した、と公式は示しています(8kと32kで256/256、140kで32/32)。
必要なものと、いま知っておきたい限界
公式のセットアップ条件は次のとおりです。MacはApple Silicon(実測はM4 Pro 24GB)、相手側はiPhone 15 Pro以降(実測は17 Pro Maxと16 Pro Max)。MシリーズチップのiPadもv0.0.2からインストール可能ですが、著者は未検証として結果投稿を求めています。接続はiPhone付属の遅いケーブルではなく、10Gb/s対応のUSB-Cが必要です。導入はおおむね「インストール用の1コマンド → スマホへ後半モデル(約5.1GB)をコピー → サーバー起動」で、Mac側のモデル一式は約24GBのダウンロードが目安です。iPhoneアプリは無料のApple IDでAltStoreから入れるか、Xcodeでビルドします。App Store配信は今後の計画、とREADMEにあります。
限界も率直に書かれています。64kを超えるとiPhoneの役割が「後半レイヤー計算」から「古い文脈の参照計算」に切り替わり、両方を同時にはまだできません。利用中はiPhoneアプリを前面に出しておく必要があり、特に64k超で古い文脈を預けたあとに15秒応答が途切れるとサーバーが止まります(画面ロックやケーブル抜けに注意。公式はGuided Accessの利用を案内)。同時に処理できる要求は1件です。Wi-Fi利用時の安全性については、v0.0.3で「以前にケーブルでペアリングしたMacだけに暗号化トンネルで応答する」修正が入っており、古いアプリは更新が推奨されています。USB接続時は基本的にMac以外には応答しません。
ビジネスパーソンにとっての意味
いますぐ全社員の標準装備、という段階ではありません。プレリリースであり、長いコードやツール結果をローカルAIに読ませる開発者・検証担当向けの実験色が強いです。一方で、「クラウドに上げにくい資料を、手元のMacで読ませたい」「メモリ24GBのノートでは長い会議録や契約関連の下読みがすぐ上限に当たる」といった現場には、余っている新しいiPhoneを計算資源に変える選択肢として意味があります。
社内で検討するなら、まず「本当にローカルで扱うべきデータか」を切り分け、Mac単体のローカル実行(たとえばLM Studioなど)で足りる範囲と、Backburnerのような分散が必要な範囲を分けて考えると失敗が少ないでしょう。関連して、当サイトではローカルLLMの始め方や、クラウド依存を減らす視点も整理しています。
詳しくはLM StudioでローカルLLMを動かす方法と、ローカルLLMが必要になる理由もあわせてご覧ください。
まとめ
Backburnerは、iPhoneをMacの「外付け計算ブースター」にして、ローカルAIの資料読み込み待ちを短縮し、長い文脈の一部をスマホ側に預けるオープンソースの試みです。開発者測定ではプレフィルが最大約44%速くなり得ますが、回答生成そのものの加速は主にMac側最適化の恩恵で、iPhone追加の効果とは区別して読む必要があります。対応端末・高速USB-C・専用アプリ・前面表示の維持など条件ははっきりしており、プレリリースのいまは「試す人向け」です。それでも、「手元のスマホを遊ばせず、データを外に出さない計算力を足す」という方向性は、これからローカルAIを育てたい組織のヒントになるでしょう。
参考リンク
- GitHub:StayLameBro/backburner(公式リポジトリ・README)
- GitHub Releases:Backburner releases(v0.0.1〜v0.0.4)
- PC Watch:iPhoneをつないでMacのローカルAIを高速化するツール
- XenoSpectrum:iPhoneでMacのローカルAIを最大44%高速化 開発者が独自ソフト「Backburner」を公開
- llama.cpp派生本体:StayLameBro/backburner-llama.cpp


コメント