スマートウォッチが表示する数字は、どこまでが「測ったもの」で、どこからが「推定したもの」なのか。この線引きを指標ごとに整理したレビュー論文が、査読誌『Sensors』に掲載されました。ミシガン大学のキネシオロジー学部などの研究チームによるもので、2026年7月15日付です。

論文は特定の機種をランキングするものではなく、指標ごとの読み方を示している(画像はイメージです)
結論を先に書くと、著者らの主張は「スマートウォッチの出力の多くは直接の生理学的測定ではなく、センサー信号と独自アルゴリズムとユーザー情報から作られた推定値である」という一点に集約されます。そのうえで、どの指標なら何に使えるのかを表にまとめています。
ここでは、その中身をSWLの読者向けに整理します。
どういう論文なのか
掲載誌は『Sensors』(2026年26巻14号、論文番号4486)で、オープンアクセスです。著者はミシガン大学キネシオロジー学部のAdam S. Lepley氏ら4名。系統的レビューではなくナラティブレビューで、既存の検証研究やメタ分析を統合し、実務で使える判断の枠組みに翻訳することを目的としています。
つまり「どの機種が一番正確か」を決める論文ではありません。「その数字が何から作られていて、何に使ってよいのか」を考えるための地図です。
数字ができるまでの5段階
論文が最初に置いているのが、次の流れです。
センサー → 信号 → アルゴリズム → 生理学的・行動的な構成概念 → 判断
加速度センサーやPPG(光電容積脈波)センサーが拾った生データが、処理されて信号になり、独自アルゴリズムを通って「消費カロリー」「睡眠ステージ」「回復度」といった名前のついた値になり、最後にユーザーが何かを決める材料になる、という順序です。
この各段階に、別々の妥当性が要ります。
妥当性の種類
問い
分析的妥当性
センサーが元の信号を正しく捉えているか(例:PPGが手首の血液量の変化を捉えているか)
アルゴリズム的妥当性
信号から出力への変換が正しいか(例:PPG波形から心拍数を出せているか)
構成概念妥当性
その出力が測りたいものを表しているか(例:PPG由来の心拍数が本当の心拍を表すか)
生態学的妥当性
実生活で機能するか(動き、装着位置、肌の色、汗、気温などの影響下で)
ラボで良い成績を出した指標が、日常生活でも同じ精度とは限らない、というのが4つ目の意味です。
指標別の信頼度一覧
論文のTable 1をもとに、主要な指標を整理しました。数字はいずれも論文が引用している検証研究の値です。
指標
基準となる検査
報告されている精度
使ってよい範囲
心拍数
多誘導心電図
安静・定常時でMAE約2bpm、MAPE10%未満。動きが大きいと悪化
安静時のトレンド把握。臨床の代わりにはならない
SpO2(血中酸素)
動脈血ガス分析
正常域でRMSE約2〜3%。低酸素域では信頼性低下
ウェルネス目的の目安
HRV
心電図由来のHRV
安静時はICC 0.96〜0.98で高一致。動くと大きく低下
安静・睡眠中の個人内トレンド
単導心電図
医師が読む12誘導心電図
心房細動の判別で感度・特異度が90〜95%超
受診のきっかけとしてのスクリーニング
VO2max
呼気ガス分析つき運動負荷試験
MAPE約5〜13%。高い競技レベルほど誤差が大きい
個人内の変化の追跡
消費カロリー
二重標識水法、代謝チャンバー
誤差が±10〜20%を超えることが多い
相対的な運動量の目安まで
睡眠/覚醒の判定
睡眠ポリグラフ検査
感度95%以上、一致率90%超
睡眠時間の長期的な把握
睡眠ステージ
睡眠ポリグラフ検査
感度50〜86%。じっとした覚醒を浅い睡眠と誤りやすい
参考程度。臨床判断には使えない
レディネス/回復スコア
基準そのものが存在しない
各社の重み付けは非公開で、検証もほぼされていない
アルゴリズムによる要約として読む
体組成(BIA)
4成分モデル、DXA、MRI
MAPE約9〜19%。体脂肪率が高い人ほど誤差が大きい
条件を揃えた個人内の変化
歩数・ケイデンス
実測
屋外の通常歩行で誤差10%未満
日常の活動量として使える
ストライド長・接地時間
3次元モーションキャプチャ
MAPE約15〜19%、一致係数0.30〜0.39
手首だけの計測は慎重に
カフレス血圧
カフ式血圧計、観血的動脈圧
ICUの検証で誤差5mmHg以内は約50〜85%
高血圧の診断・管理には使わない
発汗量・水分状態
体重変化、電解質分析
MAPE約25〜33%
水分補給の計画のきっかけ程度
非侵襲血糖
血漿グルコース、CGM
市販機に承認済みのものはない
臨床用途は不可
こうして並べると、同じ「スマートウォッチの数字」でも信頼度が桁違いに違うことが見えてきます。
とくに知っておきたい3つ
1. あなたのHRVは、たぶんHRVではない
臨床のHRVは、心電図のR-R間隔(心臓の電気的な拍動の間隔)から計算します。一方、光学式センサーの時計が出しているのはPRV(脈拍変動)で、手首の脈波のピーク間隔から求めた別物です。
脈は心臓から手首まで届くのに時間がかかり、その時間自体も一定ではありません。論文は「PRVはHRVと厳密には交換できない」「臨床的な代替として扱うべきではない」と明記しています。
精度はサンプリング周波数に強く依存し、100〜200Hzならバイアスは2%未満だが、40〜50Hzでは20%を超えるとされています。同じ「HRV」という表示でも、機種によって土台が違うということです。
安静時や睡眠中の自律神経のバランスを、自分の中での傾向として追う。この使い方なら有効だというのが論文の立場です。
2. 消費カロリーは個人の判断に使うには粗い
消費カロリーは、心拍、加速度、GPS、そして本人が入力した年齢・性別・身長・体重から組み立てられる推定値です。基礎代謝の部分は身体情報からの計算なので、入力を間違えるとそのまま誤差になります。
複数のシステマティックレビューが「個人の意思決定に使うには精度が足りない」と結論しており、誤差が±10〜20%を超えることが多いとされています。傾向としては低〜中強度で過小、高強度で過大に出て、±10%の範囲に一貫して収まったブランドはないとのことです。体重が重い人ほど誤差が大きくなることも指摘されています。
SWLでも消費カロリーがなぜ低く出るのかを実測で検証したことがありますが、この論文が示しているのはその構造的な理由です。
3. レディネススコアには「正解」が存在しない
各社が独自の名前で出している回復度やレディネスのスコアは、安静時心拍、HRV、睡眠時間、運動量などを合成した値です。
問題は、比較すべきゴールドスタンダードが存在しないことです。10社14種類の合成スコアを評価した研究では、独自の重み付けについて公表された検証がほとんどなく、理論的な説明が経験的な証拠より前に出ていると指摘されています。
同じ生理データでも、機種が違えば違うスコアになる。だから論文は、これらを「生理学的な測定値」ではなく「アルゴリズムによる要約・解釈」として読むよう求めています。
肌の色による誤差と、FDAの動き
光学式センサーは、皮膚のメラニン量の影響を受けます。緑色光のPPGでは信号対雑音比が下がって心拍が低めに出やすく、SpO2で使う赤色光・赤外線では比率が偏って酸素飽和度が高めに出やすいとされています。
これは公平性の問題でもあり、米国FDAは2025年に、パルスオキシメータの検証データで肌の色のサブグループごとの報告を求めるガイダンスを更新しています。
年齢、BMI、性別によっても手首の血流や装着状態が変わるため、ある集団での検証結果を別の集団にそのまま当てはめられない、というのが論文の指摘です。
血圧と血糖はいまどこにいるのか
カフレス血圧は、脈波の到達時間から血圧を推定する仕組みです。2025年7月には手首装着型のシステムが米国で510(k)クリアランスを取得しました(24時間ごとのキャリブレーションが条件)。
一方で、2025年のAHA科学声明とAHA/ACCの高血圧ガイドラインは、現行のカフレス機器を高血圧の診断・管理に使わないよう勧告しています。キャリブレーション直後がもっとも正確で、運動、睡眠、姿勢の変化、服薬などで精度が落ちていくためです。継続的なモニタリングがいちばん役立つ場面ほど誤差が出やすい、という皮肉な構造になっています。
血糖については、市販のスマートウォッチで非侵襲的に測れるものは存在しません。FDAは「スマートウォッチやスマートリングで血糖値を測らないように」という安全性通知を出しています。時計の画面に血糖値が出るのは、承認済みのCGM(持続グルコースモニター)のデータを中継している場合だけです。
同じ「心拍」でも、機種が違えば別物
論文が1章を割いているのが、機器間の比較可能性です。
2つの時計が同じ「心拍数」「歩数」「睡眠時間」というラベルの値を出していても、使っているセンサー、フィルタ処理、集計方法、アルゴリズムの前提はそれぞれ違います。同じ用語だからといって、同じものを測っているとは限らないということです。
具体例として挙がっているのが「ストライド長」です。通常は2歩ぶんの距離を指しますが、開発者向けドキュメントを見ると、1歩ぶんの距離を報告している機器もあるとのことです。
さらに、ファームウェアやアルゴリズムの更新で出力が変わることがあり、その変更が明示されないこともあります。長期間データを取っている人にとっては、数値の変化が身体の変化なのかソフトウェアの変化なのか区別がつかないという問題になります。
SWLでも左手にApple Watch、右手にFitbitを着けて4日間過ごしたデータ比較を試したことがありますが、ズレが出るのは当然だとこの論文は説明しています。
で、どう使えばいいのか
論文の実践的な推奨は、突き詰めるとこうなります。
個人内のトレンドを追うのに使う。安静時心拍、日々の活動量、睡眠時間、トレーニング負荷の変化は、絶対値に多少の誤差があっても、自分の中での動きとして意味を持ちます。
他人との比較、診断、厳密な定量には慎重になる。消費カロリー、有酸素能力、睡眠、水分状態、回復度といった複雑な構成概念については、特にそうです。
そして使える指標だけ見る。データが取れるからという理由で全部の数字を追いかけない、というのも論文の推奨です。著者らは「orthosomnia(睡眠データに囚われて逆に眠れなくなる状態)」を扱った先行研究も引いています。
自分の睡眠を数字で見るなら、厚生労働省の睡眠ガイド2023と照らし合わせる読み方も参考になります。
まとめ
この論文が示しているのは、スマートウォッチが役に立たないという話ではありません。「何を測れるか」ではなく「何を測るべきか、なぜそれが重要か、その数字をどう責任を持って使うか」へ問いを移すべきだ、という提案です。
指標ごとに信頼度は大きく違います。心拍と歩数は日常的な判断に使える水準にあり、心電図による心房細動のスクリーニングは受診のきっかけとして機能します。一方で、消費カロリーや回復スコアを1桁の精度で受け取るのは、そもそも設計上の想定を超えています。
自分の時計の数字を見るとき、「これはセンサーが測った値か、アルゴリズムが推定した値か」を一度考えてみる。それだけでも、数字との距離の取り方が変わってきます。
Source:Lepley et al., “Consumer Smartwatch Technology in Health and Performance Research: Validity, Limitations, and Real-World Applications”, Sensors 2026, 26(14), 4486(オープンアクセス、CC BY)
あわせて読みたい関連記事
消費カロリーが低く出る理由を実測で確かめています。
スマートウォッチの消費カロリーはなぜ低く出るのか? 厚労省の内訳と実測データで検証
基礎代謝をどう扱っているかは各社で違います。
スマートウォッチは消費カロリーの「基礎代謝」まで測れるの? 各社の仕組みを比較
体組成の「DEXAと相関98%」をどう読むかも整理しました。
Galaxy Watchの「体組成」とは? 体重と身長は手動入力、時計が測るのは骨格筋量と体脂肪率|測り方のコツと「DEXAと相関98%」の読み方
睡眠データの読み方はこちらです。
スマートウォッチの睡眠データはどう読む? 厚生労働省「睡眠ガイド2023」と照らし合わせる
2台を同時に着けたときのズレを実際に試しています。
左手にApple Watch、右手にFitbitを着けっぱなしで過ごした4日間のデータ比較。スタンフォード大の研究は正しいか
心電図が実際に受診につながった事例もあります。
Apple Watchの心電図がトライアスリートの心房細動を捉えた|受診で先天性の心疾患が判明し開胸手術へ、Appleが実話動画を公開【海外ニュース】
はじめての方・記事の探し方に迷った方へ
記事が多くて迷ったら、
記事の探し方ガイド
から目的別に読めます。
※本記事のリンクから商品を購入すると、売上の一部が販売プラットフォームより当サイトに還元されることがあります。掲載されている情報は執筆時点の情報になります。
