Bytes, Datenwörter Datei- und Speichergrößen: Kilo, Mega, Giga, etc. Informationsdarstellung: ASCII Code Probleme des ASCII Codes Teillösung ISO 8859 Unicode UTF-8 Binär-, Dezimal- und Hexadezimalsystem Umwandlung vom Dezimal- ins Binärsystem Umwandlung vom Dezimal- ins Hexadezimalsystem Themenüberblick „Grundlagen II“
Die Anzahl der Bits wächst linear, die Anzahl der Zustände wächst exponentiell, so dass gilt: Für Bitfolgen der Länge n gibt es genau 2n mögliche Bitfolgen. 1 Bit = 21 = 2 Bitfolgen (0 oder 1) 2 Bit = 22 = 4 Bitfolgen (00, 01, 10, 11) 3 Bit = 23 = 8 Bitfolgen (000, 001, 010, 011, 100, 101, 110, 111) 4 Bit = 24 = 16 Bitfolgen (0000, 0001, ...., 1111) Hausaufgaben
des Alphabets zu codieren? A, B, C, D, E, F, G, H, I, J, K, L, M, N, O, P, Q, R, S, T, U, V, W, X, Y, Z 1 Bit = 2 Symbole 2 Bit = 4 3 Bit = 8 4 Bit = 16 5 Bit = 32 Symbole Plus Kleinbuchstaben: 52 Symbole zu codieren: 6 Bit = 64 Symbole Hausaufgaben
Textdarstellung und –repräsentation durch Abstraktion, d.h. Codierung: Wir weisen jedem Zeichen eine Folge von Bits zu Mit 7 Bit lassen sich 27 = 128 verschiedene Zeichen codieren Informationsdarstellung (Schrift)zeichen Dezimal Binär <Escape> 27 (0)0011011 … … … A 65 (0)1000001 B 66 (0)1000010 C 67 (0)1000011 … … … <Del> 127 (0)1111111
– der Urbildmenge – eindeutig ein Zeichen oder eine Zeichenfolge aus einem Zeichenvorrat – der Bildmenge – zu. Beispiel: Verschiebe- / Cäsar-Code: Urbildmenge: abcdefghijklmnopqrstuvwxyz Bildmenge: defghijklmnopqrstuvwxyzabc (um drei Zeichen des Alphabets verschoben) hello world khoor zruog Codierung a b c d e f g h i j k l m n o p q r s t u v w x y z d e f g h i j k l m n o p q r s t u v w x y z a b c
Sicherheit der Datenübertragung sicherstellen: Das erste Bit wurde auf 0 gesetzt, wenn die Anzahl der übrigen Bits gerade ist und auf 1 gesetzt, wenn die Anzahl der übrigen Bits ungerade ist: ? 0 0 0 0 0 0 1 1 0 0 0 0 0 0 1 ASCII: Probleme
für Normung (International Organization for Standardization) Spezifiziert die zusätzlich darstellbaren Zeichen; dabei entsprechen die ersten mit sieben Bit kodierbaren Zeichen (einschließlich führendes Nullbit) dem ASCII Code 15 Normen, von ISO 8859-1 bis 8859-16 Teillösung: ASCII ISO 8859
Mitteleuropäisch ISO 8859-3 Latin-3, Südeuropäisch ISO 8859-4 Latin-4, Baltisch ISO 8859-5 Kyrillisch ISO 8859-6 Arabisch ISO 8859-7 Griechisch ISO 8859-8 Hebräisch ISO 8859-9 Latin-5, Türkisch … … ISO 8859-16 Latin-10, Südosteuropäisch
Intention: Darstellung mehrerer unterschiedlicher Sprachen mit einer Zeichencodierung Ziel: Alle in Gebrauch befindlichen Schriftsysteme und Zeichen zu codieren. Versionen: Unicode codierte seine Zeichen zunächst über 16 Bit (65536 Zeichen). Unicode 2.0 erweitert Zeichenraum auf 17 Bereiche (Planes), kann 1.114.112 Zeichen darstellen. Ein weiterer Standard: Unicode
Organization for Standardization) UTF Implementierung von Unicode UTF-8 ist eine Mehrbyte-Codierung. Das bedeutet: Dass 7-Bit ASCII-Zeichen mit einem Byte codiert werden, alle anderen verwenden zwischen 2 und 6 Bytes Die Idee: Häufig benutzte Zeichen werden mit einem Byte codiert, seltenere mit mehreren Bytes – das spart Speicherplatz. UTF-8 codierte Dateien sind kompatibel zu 7-Bit ASCII Und noch ein Standard: UTF-8
H, e, l, l, o, , W, o, r, l, d Jedes Zeichen ersetzen durch seine Nummer im ASCII-Code Dezimaldarstellung: 72 101 108 108 111 32 87 111 114 108 100 Binärdarstellung: 1001000 1100101 1101100 1101100 … Zeichensätze: Die Praxis
(0 und 1) Antwortmöglichkeiten codieren. Nibble = Halb-Byte (=4 Bit) Byte = Zwei Nibble, d.h. 8 Bit Wort = Zwei Byte 16 Bit Doppelwort = 2x Wort, 32 Bit Gut zu wissen
ASCII Code (1967 entworfen) verwendet 7 Bits zur Repräsentation der Zeichen. Das erste Bit dient(e) der Sicherstellung der Informationsübertragung. Problem ASCII Code: Anzahl der Zeichen (128 bzw. 256) zu gering ISO 8859 baut auf ASCII auf, verwendet das erste Bit zur Erweiterung des Zeichensatzes Gut zu wissen III