Simplified Molecular Input Line Entry Specificationとは? わかりやすく解説

Weblio 辞書 > 辞書・百科事典 > 百科事典 > Simplified Molecular Input Line Entry Specificationの意味・解説 

SMILES記法

(Simplified Molecular Input Line Entry Specification から転送)

出典: フリー百科事典『ウィキペディア(Wikipedia)』 (2026/08/13 23:41 UTC 版)

SMILES記法スマイルスきほう、英語: simplified molecular input line entry system)とは、分子化学構造ASCII符号の英数字文字列化した、構造の曖昧性の無い表記方法である。SMILES文字列は多くの種類の分子エディタにおいてインポート可能で、二次元の図表あるいは三次元のモデルとして表示することができる。

SMILES表記は1980年代の終わりにDavid Weiningerにより開発され、その後に多数の人の手で変更あるいは拡張がなされてきた。中でもDaylight Chemical Information Systems社の貢献が大きい。他の線形な同様な表記法としてはWiswesser Line Notation (WLN), ROSDAL そして SLN (Tripos社)が挙げられる。

グラフ理論に基づいた記法の定義

グラフ理論に基づくコンピュータ処理の観点では、SMILESは分子グラフ英語版深さ優先で走査して、節点原子)と結合)を表現する文字列である。分子グラフの構築では、まず系の水素原子を取り除き(ただし不斉中心を除く)、環を形成しているところは切り開いて全域木spanning tree)に変換する。環を開いたところには数字でラベル付け(後置)して、つながっていた節点同士を示す。丸括弧parenthesis, ())はが分枝している場所を表すのに使用する。

原子は角括弧bracket, [])でくくられるが、organic subset、すなわち B, C, N, O, P, S, F, Cl, Br, I のいずれかで、形式電荷を持たず、同位体を陽に指定する必要がなく、かつ不斉中心でない場合は[]を省略してもよい。この場合は原子価に基づいて水素が暗黙的に付加しているものとみなされる。たとえばONはそれぞれアンモニアである(水素を陽に書くと[H]O[H]などになるが、このように書かれることはほとんどない)。形式電荷を持っている場合は+-と数字を後置する(たとえばアンモニウムイオン[NH4+] (II) は[Fe+2])。同位体を陽に指定する場合は質量数を整数で前置する(たとえば炭素14[14C])。不斉中心については後述する。

結合は一重から順に-=#で、芳香環(1.5重結合)では:で表される(ただし一重結合-は通常省略される)。OpenSMILES 拡張で四重結合は$ である。二重結合=につながっている一重結合の向きを/\\で表すことでシス-トランス異性体を区別する。たとえばC/C=C\\CC/C=C/Cはそれぞれシス・トランス2-ブテンである。結合がないことは.で表現される(たとえば過酸化水素OOに対しO.Oは水2分子)。

環構造ではつながっている原子の後ろに数字でラベル付けする。たとえばプロパンシクロプロパンをSMILESで表すとそれぞれCCCC1CC1となる。 ラベルの数字は1つの原子に1つが原則だが、あるラベルがすでに2箇所に現れ、その2箇所のペアが同一の原子であることを示す役目を終えた場合は、その数字を別のペアのために再利用してもよい。 ラベルは一桁の数字とみなされ、たとえばC12はラベル12につながっている炭素である。二桁のラベルを表すには%を前置する(たとえばC%12はラベル12)。

芳香環を構成する原子(炭素窒素酸素リン硫黄ヒ素セレン;OpenSMILES 拡張ではさらにホウ素)は小文字にする。例えばシクロヘキサンC1CCCCC1に対しベンゼンc1ccccc1である。芳香環の結合を一重・二重結合で表すこと(ベンゼンを1,3,5-シクロヘキサトリエンのようにC1=CC=CC=C1)をケクレ化 (英語: kekulization) とよぶことがある。

不斉中心には@または@@を後置し、の方向から見てそれぞれ左回り・右回りに後続の原子団が並んでいることを表す(@が左回りのため)。たとえばS-アラニンのSMILESは、アミノ基を根にするとN[C@@H](C)C(=O)Oである(N[C@@]([H])(C)C(=O)Oのように書いてもよい)。

ある系についてのSMILESは必ずしも一意に定まらず、たとえばS-アラニンは上記のSMILESだけでなく、C[C@H](N)C(=O)OC[C@@H](C(=O)O)NOC(=O)[C@H](C)Nなどでも表すことができる。そのため、あるアルゴリズムに基づいて系に対し一意になるよう変換したものを、正規化された(canonical)SMILESと呼ぶ。ただし、データベースやプログラムによってはアルゴリズムが違うことがある。

化学反応は原系>>生成系または原系>触媒など>生成系で表される。たとえばプロペンに水が付加してプロパン-2-オールができる反応はCC=C.O>>CC(O)Cである。

詳細については[1][2]を参照すること。

発展

SMARTS[3]は部分構造検索ができるようにSMILESを拡張したものであり、化学データベース検索プログラムなどで使用される。原子ならびに結合についてのクエリが追加されており、たとえば[C,c]は任意の(脂肪族または芳香族の)炭素にマッチする。

SMIRKS[4]はSMILESとSMARTSのハイブリッドで、一般的な化学反応を記述する。

特徴

SMILES記法の長所は化学構造を、少ないバイト長で表現できることと、ルールが簡単なので人間が文字列に変換する際に複雑な演算が不必要な点にある。

SMILESの実装上の位置づけは、単なる短い別名ではなく、分子構造の性質とトポロジーを文字列として記述する線形表記である[5]。分子および反応を入力・表現するための印字可能文字による線形表記であり、拡張接続表と同等の情報を含む一方で、コンピュータ内部のデータ構造ではなく、原子記号と結合記号を語彙とする単純な文法をもつ言語的構成物であるため、化学データベースのアクセスキー、研究者間の化学情報交換、化学データ入力、人工知能エキスパートシステムにおける語彙として用いられる[6]

一つの分子に複数の妥当なSMILESがあり得るため、ラベル付き分子グラフだけを表すものはgeneric SMILES、同じ構造に対する妥当な表記の中からアルゴリズムで一つを選ぶものはunique SMILES、同位体キラリティーの指定を含むものはisomeric SMILES、unique isomeric SMILESはabsolute SMILESと呼ばれる[6]。この分類では、同じ分子に複数のSMILESが存在し得ること、正規化されたSMILESが実装依存のアルゴリズムで生成されること、不斉中心や同位体情報の有無が表記の種類を分けることが同じ枠組みで扱われる[6]

OpenSMILES仕様は、SMILESがDaylight Chemical Information Systemsの独自仕様として始まり、1980年代末の導入後に分子構造交換のデファクトスタンダードとして受け入れられたことを前提に、Blue Obeliskプロジェクトの下でコミュニティからの貢献を受ける非独自仕様として策定された[7]。同仕様では、原子、結合、括弧、数字などの書き方を扱う構文と、それらの記号を妥当な分子として解釈する意味論を分けて説明し、SMILESが基礎に置く原子価モデルの限界として、互変異性芳香族性、非整数的な結合、水素結合などが単純な整数結合の枠に収まりにくいことを挙げている[7]

一方、欠点としては元の構造式の向きや置換基が張り出す方向などの構造式を目で見たときの印象が完全に失われる点がある。ほかにも、標準SMILES記法では相対配置も絶対配置も表現することができない。

実例

分子 構造 SMILES記法
窒素 N≡N N#N
イソシアン酸メチル (MIC) CH3N=C=O CN=C=O
硫酸銅(II) Cu2+ SO42- [Cu+2].[O-]S(=O)(=O)[O-]
エナントトキシン (C17H22O2) エナントトキシンの構造式 CCC[C@@H](O)CC\\C=C\\C=C\\C#CC#C\\C=C\\CO
ピレトリン II (C21H28O5) ピレトリンの構造式 COC(=O)C(\\C)=C\\C1C(C)(C)[C@H]1C(=O)O[C@@H]2C(C)=C(C(=O)C2)CC=CC=C
アフラトキシンB1 (C17H12O6) アフラトキシンB1の構造式 O1C=C[C@H]([C@H]1O2)c3c2cc(OC)c4c3OC(=O)C5=C4CCC(=O)5
グルコース (glucose, glucopyranose) (C6H12O6) グルコースの構造式 OC[C@@H](O1)[C@@H](O)[C@H](O)[C@@H](O)[C@@H](O)1
クスクチン又の名ベルゲニン(天然樹脂) (C14H16O9) クスクチソの構造式 OC[C@@H](O1)[C@@H](O)[C@H](O)[C@@H]2[C@@H]1c3c(O)c(OC)c(O)cc3C(=O)O2
カリフォルニア州カイガラムシフェロモン (3Z, 6R)-3-methyl-6-(prop-1-en-2-yl)deca-3,9-dien-1-yl acetate CC(=O)OCCC(/C)=C\\C[C@H](C(C)=C)CCC=C
2S,5R-カルコガラン:キクイムシ(ホシガタキクイムシ(Pityogenes chalcographus))のフェロモン [8] (2S, 5R)-2-ethyl-1,6-dioxaspiro[4.4]nonane CC[C@H](O1)CC[C@@]12CCCO2
バニリン バニリンの構造式 O=Cc1ccc(O)c(OC)c1
メラトニン (C13H16N2O2) メラトニンの構造式 CC(=O)NCCC1=CNc2c1cc(OC)cc2
フラボペレイリン (C17H15N2) フラボペレイリンの構造式 CCc(c1)ccc2[n+]1ccc3c2Nc4c3cccc4
ニコチン (C10H14N2) ニコチンの構造式 CN1CCC[C@H]1c2cccnc2
ツジョン (C10H16O) ツジョンの構造式 CC(C)[C@@]12C[C@@H]1[C@@H](C)C(=O)C2
チアミン (C12H17N4OS+)
(vitamine B1)
チアミンの構造式 OCCc1c(C)[n+](=cs1)Cc2cnc(C)nc(N)2

脚注

  1. Daylight Theory: SMILES”. 2019年10月9日閲覧。
  2. OpenSMILES specification (2016年5月15日). 2019年10月9日閲覧。
  3. Daylight Theory: SMARTS - A Language for Describing Molecular”. 2019年10月9日閲覧。
  4. Daylight Theory: SMIRKS - A Reaction Transform Language”. 2019年10月9日閲覧。
  5. simplified molecular input line entry system”. IUPAC Gold Book. International Union of Pure and Applied Chemistry. 2026年6月27日閲覧。
  6. 1 2 3 Daylight Theory: SMILES”. Daylight Chemical Information Systems. 2026年6月27日閲覧。
  7. 1 2 Craig A. James (2016年5月15日). OpenSMILES specification”. GitHub. 2026年6月27日閲覧。
  8. ISOLATION OF PHEROMONE SYNERGISTS OF BARK BEETLE, Pityogenes chalcographus, FROM COMPLEX INSECT-PLANT ODORS BY FRACTIONATION AND SUBTRACTIVE-COMBINATION BIOASSAY

関連項目

外部リンク


「Simplified molecular input line entry specification」の例文・使い方・用例・文例

Weblio日本語例文用例辞書はプログラムで機械的に例文を生成しているため、不適切な項目が含まれていることもあります。ご了承くださいませ。


英和和英テキスト翻訳

英語⇒日本語日本語⇒英語

辞書ショートカット

すべての辞書の索引

「Simplified Molecular Input Line Entry Specification」の関連用語

1
10% |||||

Simplified Molecular Input Line Entry Specificationのお隣キーワード
検索ランキング

   

英語⇒日本語
日本語⇒英語
   



Simplified Molecular Input Line Entry Specificationのページの著作権

   
ウィキペディアウィキペディア
All text is available under the terms of the GNU Free Documentation License.
この記事は、ウィキペディアのSMILES記法 (改訂履歴)の記事を複製、再配布したものにあたり、GNU Free Documentation Licenseというライセンスの下で提供されています。 Weblio辞書に掲載されているウィキペディアの記事も、全てGNU Free Documentation Licenseの元に提供されております。
Tanaka Corpusのコンテンツは、特に明示されている場合を除いて、次のライセンスに従います:
 Creative Commons Attribution (CC-BY) 2.0 France.
この対訳データはCreative Commons Attribution 3.0 Unportedでライセンスされています。
浜島書店 Catch a Wave
Copyright © 1995-2026 Hamajima Shoten, Publishers. All rights reserved.
株式会社ベネッセコーポレーション株式会社ベネッセコーポレーション
Copyright © Benesse Holdings, Inc. All rights reserved.
研究社研究社
Copyright (c) 1995-2026 Kenkyusha Co., Ltd. All rights reserved.
日本語WordNet日本語WordNet
日本語ワードネット1.1版 (C) 情報通信研究機構, 2009-2010 License All rights reserved.
WordNet 3.0 Copyright 2006 by Princeton University. All rights reserved. License
日外アソシエーツ株式会社日外アソシエーツ株式会社
Copyright (C) 1994- Nichigai Associates, Inc., All rights reserved.
「斎藤和英大辞典」斎藤秀三郎著、日外アソシエーツ辞書編集部編
EDRDGEDRDG
This page uses the JMdict dictionary files. These files are the property of the Electronic Dictionary Research and Development Group, and are used in conformance with the Group's licence.

©2026 GRAS Group, Inc.RSS