投稿

ラベル(文字コード)が付いた投稿を表示しています

6月14日(水)1コマ目

イメージ
今日、やったこと 文字コード 今日のホワイトボード 前回のおさらい コンピュータ初期のころに誕生したASCII、JIS X 0201は文字集合と符号化方式が一緒になっている。 そのあと、文字集合と符号化方式は別々に扱われるようになる。 図 ASCII、JIS X 0201は文字集合+符号化方式、JIS X 0208は文字集合 Shift_JIS Shift_JISは符号化方式。文字集合は別に決められたJIS X 0201、JIS X 0208を使う。 JIS X 0201の文字は1文字1バイト、JIS X 0208の文字は1文字2バイト。 ※JIS X 0201はShift_JISより前から使われているため、互換性を持たせるために同じ符号に変換する。 図 Shift_JIS Shift_JISにはCP932やWindows-31Jなど亜種が存在する。 EUC-JP UnixやLinuxなどで使われていた符号化方式。 文字集合はJIS X 0201、JIS X 0208を使う。 図 EUC-JP 練習問題(p.21 スライドNo.41、42) JIS X 0208の文字は区点に0xA0を足す。 図 EUC-JPで符号化 UTF-8 今最も使われている符号化方式。 文字集合はUnicode。 ちなみにUnicodeでは各文字にU+xxxxという番号を割り当てている(JIS X 0208の区点とおなじようなもの)。 図 UTF-8で符号化 次回は 文字コードのテストをします。  

6月7日(水)1コマ目

イメージ
今日、やったこと [確認テスト]誤差 文字コード 今日のホワイトボード (用語)文字符号化方式 文字<=>数値 の変換ルールが文字符号化方式。 図 文字符号化方式とは ASCII 一番最初に生まれた文字集合+符号化方式。 アルファベット、数字、記号だけなので7ビット長で十分。 図 ASCIIで符号化 JIS X 0201 ASCIIを日本用に拡張。 8ビット長にして、半角カタカナを追加した。 図 JIS X 0201で符号化 おまけ C言語でアルファベットのAからZを表示する際、下図のコードで出力できる。 図 ’A'から’Z'まで表示する ASCIIの表を見ると、'A'から'Z'は連続している。よって、符号化された値も0x41から0xに連続しているため、変数chをインクリメントすれば’A'から順にアルファベットが表示される。 次回は 文字コードの続きをやります。 

5月31日(水)1コマ目

イメージ
今日、やったこと 誤差(ケタ落ち、情報落ち) 文字コード 今日のホワイトボード 有効ケタ数とは 実際に測定した値が格納されているケタが有効ケタ。 桁数合わせのために入れた値は信頼できない値。有効ケタではない。 図 有効ケタ数 [誤差]ケタ落ち 近い値同士の引き算をする際、正規化をすることで、信頼できない値が挿入される。このタイミングで有効ケタ数が減る。これがケタ落ち。 図 ケタ落ち [誤差]情報落ち 離れた値同士の計算をする際、指数部を合わせる。このとき、仮数部のデータが消えてしまうことがある。これが情報落ち。 図 情報落ち 文字コード 一般的によく使われている「文字コード」という単語は利用する局面で指すものが異なるケースが多い。よって、この授業ではなるべく文字コードという単語は使わないようにする。 文字集合、符号化 コンピュータでは各文字にオンリーワンな番号を割り当てて、その番号で文字を扱っている。 番号を振る文字の集まりが文字集合。 符号化とは、各文字にオンリーワンな番号(符号)を割り当てること。 図 文字集合、符号化 ISO、JIS いずれも規格を作る団体やその団体が作った規格。 ISOはグローバルな規格。JISは日本だけの規格。 図 ISOとJIS 符号化文字集合 各文字に符号を割り当てた文字集合を符号化文字集合。 図 文字集合と符号化文字集合 次回は 誤差の確認テストをします。 文字コードの続きをやります。