Merkistöt ja merkkikoodaukset

← Takaisin lomakkeelle

1. ASCII-merkistö on 7-bittinen

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Oikein – ASCII käyttää 7 bittiä ja sisältää 128 mahdollista merkkiä.

2. Merkistö on synonyymi engl. character set

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Oikein – character set tarkoittaa suomeksi merkistöä.

3. Merkki € löytyy ASCII-merkistöstä

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – ASCII sisältää vain 128 merkkiä eikä €-merkkiä.

4. Encoding on sama kuin merkistö

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – encoding tarkoittaa merkkien koodaustapaa. Merkistö määrittelee merkit ja niiden koodipisteet.

5. Mikä on merkin A koodipiste ASCII-merkistössä?

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
65 desimaalina, 0x41 heksadesimaalina ja 01000001 binäärinä.

6. Miten € on koodattu Windows-1252:ssa?

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
€ on Windows-1252:ssa tavuarvolla 0x80 eli binäärinä 10000000.

7. Miten Ä ja € on koodattu UTF-8:ssa ja miten bittiyhdistelmät muodostuvat?

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Ä = U+00C4 → UTF-8: C3 84 → binäärinä 11000011 10000100. € = U+20AC → UTF-8: E2 82 AC → binäärinä 11100010 10000010 10101100. UTF-8 muodostaa tavut Unicode-koodipisteen bittien perusteella UTF-8:n määrittelemän bittikaavan avulla.

8. Windows-1252 on merkistö

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – tarkasti ottaen Windows-1252 on merkkikoodaus/koodisivu.

9. ANSI on sama kuin Windows-1252

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – ANSI on epämääräinen nimitys, jota Windowsissa on käytetty paikallisesta 8-bittisestä koodauksesta. Se ei teknisesti tarkoita aina Windows-1252:ta.

10. ANSI on sama kuin ISO-8859-1

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – ANSI ei ole sama asia kuin ISO-8859-1.

11. BOM käytetään ANSI:n kanssa

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – BOM liittyy Unicode-koodauksiin, kuten UTF-8, UTF-16 ja UTF-32.

12. Miten skandimerkit ÅÄÖ ja € voivat olla koodattu yhteen tavuun Windows-1252:ssa mutta vaativat useita tavuja UTF-8:ssa?

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Windows-1252:ssa näille merkeille on määritelty yhden tavun arvot. UTF-8:ssa merkit perustuvat Unicode-koodipisteisiin ja käyttävät muuttuvan pituista koodausta. ASCII-merkit vievät yhden tavun, mutta monet muut merkit tarvitsevat 2–4 tavua.

13. UTF-8 on merkistö

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – UTF-8 on Unicode-merkkien koodaustapa eli encoding.

14. Unicode on merkistö

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Oikein – Unicode määrittelee suuren joukon merkkejä ja niiden koodipisteet.

15. Merkistö ja merkkikoodaustapa on tallennettu tiedostojärjestelmään omalla attribuutilla

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – tiedostojärjestelmä ei yleensä tallenna tekstin koodausta omana automaattisena attribuuttinaan.

16. UTF-8 tallentaa kaikki merkit aina kahteen tavuun

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – UTF-8 käyttää merkistä riippuen 1–4 tavua.

17. ISO Latin1 on sama kuin Windows-1252

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – ISO-8859-1 ja Windows-1252 ovat hyvin lähellä toisiaan, mutta eivät täysin samoja.

18. 8-bittisessä merkistössä on 128 koodipistettä

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Väärin – 8 bitillä voidaan esittää 2^8 = 256 eri arvoa.

19. Miten voit selvittää onko tiedosto koodattu UTF-8 tai jossain muussa?

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Koodausta voi selvittää tekstieditorin asetuksista tai esimerkiksi komentorivin file-työkalulla. Myös tiedoston alussa oleva BOM voi antaa tietoa koodauksesta. Lisäksi tiedoston tavujen perusteella voidaan tarkistaa, onko sisältö kelvollista UTF-8:aa.

20. Selvitä miksi skandimerkit näyttää kummalliselta tehtävän liitteessä Motonet.jpg, miten asiaa voi korjata?

Opiskelijan vastaus:
Ei vastausta
Oikea vastaus / selitys:
Skandimerkit näkyvät väärin, jos teksti on tallennettu yhdellä merkkikoodauksella mutta tulkittu toisella. Esimerkiksi UTF-8-teksti voidaan tulkita Windows-1252-koodauksena, jolloin ä voi muuttua muotoon ä. Korjaamisessa pitää käyttää samaa koodausta koko ketjussa. Jos teksti on oikeasti JPG-kuvan sisällä, ongelma on voinut syntyä jo kuvaa muodostettaessa.