搜索

C语言教程

编程基础

通俗地理解什么是编程语言 C 语言究竟是一门怎样的语言? C 语言和 C++ 到底有什么关系? 学了 C 语言到底能做什么,能从事什么工作? 二进制、八进制和十六进制 不同进制之间的转换 数据在内存中的存储 载入内存,让程序运行起来 ASCII 编码,将英文存储到计算机 GB2312 编码和 GBK 编码,将中文存储到计算机 Unicode 字符集,将全世界的文字存储到计算机 程序员的薪水和发展方向大全 不要这样学习 C 语言,这是一个坑! 明白了这点才能学好编程,否则参加什么培训班都没用

C 语言初探

第一个 C 语言程序 选择正确的输入法,严格区分中英文 什么是源文件? 什么是编译和链接? 主流 C 语言编译器有哪些? 什么是 IDE(集成开发环境)? 什么是工程/项目? 哪款 C 语言编译器(IDE)适合初学者? 如何在手机上编写 C 语言代码? C 语言的三套标准:C89、C99 和 C11 C 语言为什么有那么多编译器? 程序安装是怎么回事? 制作安装包,让用户安装程序 C 语言程序的错误和警告 分析第一个 C 语言程序 C 语言代码中的空白符 彩色版的 C 语言,让文字更漂亮 一个真正带界面的 C 语言程序

变量和数据类型

大话 C 语言变量和数据类型 在屏幕上输出各种类型的数据 C 语言中的整数(short,int,long) 二进制数、八进制数和十六进制数 C 语言中的正负数及其输出 整数在内存中是如何存储的,为什么它堪称天才般的设计 整数的取值范围以及数值溢出 C 语言中的小数(float,double) 小数在内存中是如何存储的,揭秘诺贝尔奖级别的设计(长篇神文) 在 C 语言中使用英文字符 在 C 语言中使用中文字符 C 语言到底使用什么编码?谁说 C 语言使用 ASCII 码,真是荒谬! C 语言转义字符 C 语言中的几个重要概念 C 语言加减乘除运算 C 语言自增(++) 和自减(--) 变量的定义位置以及初始值 运算符的优先级和结合性 C 语言数据类型转换

C 语言输入输出

数据输出大汇总以及轻量进阶 在屏幕的任意位置输出字符,开发小游戏的第一步 使用 scanf 读取从键盘输入的数据 从键盘输入字符和字符串 进入缓冲区(缓存)的世界,破解一切与输入输出有关的疑难杂症 结合缓冲区谈 scanf 函数,那些奇怪的行为其实都有章可循 清空(刷新)缓冲区,从根本上消除那些奇怪的行为 scanf 的高级用法,原来 scanf 还有这么多新技能 C 语言模拟密码输入(显示星号 ) 非阻塞式键盘监听,用户不输入数据程序也能继续执行

循环结构和选择结构

else 语句 C 语言关系运算符 C 语言逻辑运算符 case 语句 C 语言条件运算符 C 语言 while 循环 C 语言 for 循环 C 语言跳出循环 C 语言循环嵌套 对选择结构和循环结构的总结 谈编程思维的培养,初学者如何实现自我突破(非常重要) 写一个内存泄露的例子,让计算机内存爆满

C 语言数组

什么是数组 C 语言二维数组 判断数组中是否包含某个元素 C 语言字符数组和字符串 字符串的输入和输出 C 语言字符串处理函数 C 语言数组是静态的,不能插入或删除元素 C 语言数组的越界和溢出 C 语言变长数组:使用变量指明数组的长度 对数组元素进行排序 对 C 语言数组的总结

C 语言函数

什么是函数? C 语言函数定义 C 语言函数的形参和实参 C 语言函数的返回值 C 语言函数的调用(从中发现程序运行的秘密) 函数声明以及函数原型 全局变量和局部变量 C 语言变量的作用域 C 语言块级变量 C 语言递归函数(带实例演示) 中间递归函数(比较复杂的一种递归) 多层递归函数(最烧脑的一种递归) 递归函数的致命缺陷:巨大的时间开销和内存开销(附带优化方案) 忽略语法细节,从整体上理解函数

预处理命令

什么是预处理命令? #include 的用法 C 语言宏定义 C 语言带参数的宏定义 带参宏定义和函数的区别 宏参数的字符串化和宏参数的连接 C 语言中几个预定义宏 C 语言条件编译 #error 命令,阻止程序编译 C 语言预处理命令总结

指针

1 分钟彻底理解指针的概念 指针变量的定义和使用 C 语言指针变量的运算 数组指针(指向数组的指针) 字符串指针(指向字符串的指针) C 语言数组灵活多变的访问形式 指针变量作为函数参数 C 语言指针作为函数返回值 二级指针(指向指针的指针) 空指针 NULL 以及 void 指针 数组和指针绝不等价,数组是另外一种类型 数组到底在什么时候会转换为指针 指针数组(数组每个元素都是指针) 一道题目玩转指针数组和二级指针 二维数组指针(指向二维数组的指针) 函数指针(指向函数的指针) 只需一招,彻底攻克 C 语言指针,再复杂的指针都不怕 main() 函数的高级用法:接收用户输入的数据 对 C 语言指针的总结

结构体

C 语言结构体 C 语言结构体数组 C 语言结构体指针 C 语言枚举类型 C 语言共用体 大端小端以及判别方式 C 语言位域 C 语言位运算 使用位运算对数据或文件内容进行加密

重要知识点补充

typedef 的用法 const 的用法 C 语言随机数

文件操作

C 语言中的文件是什么? C 语言打开文件 文本文件和二进制文件到底有什么区别? 以字符形式读写文件 以字符串的形式读写文件 以数据块的形式读写文件 格式化读写文件 随机读写文件 C 语言实现文件复制功能 FILE 结构体以及缓冲区深入探讨 获取文件大小(长度) 插入、删除、更改文件内容

C 语言调试

调试的概念以及调试器的选择 设置断点,开始调试 查看和修改变量的值 单步调试(逐语句调试和逐过程调试) 即时窗口的使用 查看、修改运行时的内存 有条件断点的设置 assert 断言函数 调试信息的输出 VS 调试的总结以及技巧

GB2312 编码和 GBK 编码,将中文存储到计算机

计算机是一种改变世界的发明,很快就从美国传到了全球各地,得到了所有国家的认可,成为了一种不可替代的工具。计算机在广泛流行的过程中遇到的一个棘手问题就是字符编码,计算机是美国人发明的,它使用的是 ASCII 编码,只能显示英文字符,对汉语、韩语、日语、法语、德语等其它国家的字符无能为力。

为了让本国公民也能使用上计算机,各个国家(地区)也开始效仿 ASCII,开发了自己的字符编码。这些字符编码和 ASCII 一样,只考虑本国的语言文化,不兼容其它国家的文字。这样做的后果就是,一台计算机上必须安装多套字符编码,否则就不能正确地跨国传递数据,例如在中国编写的文本文件,拿到日本的电脑上就无法打开,或者打开后是一堆乱码。

下表列出了常见的字符编码:
字符编码 说明
ISO/IEC 8859 欧洲字符集,支持丹麦语、荷兰语、德语、意大利语、拉丁语、挪威语、葡萄牙语、西班牙语,瑞典语等,1987 年首次发布。

ASCII 编码只包含了基本的拉丁字母,没有包含欧洲很多国家所用到的一些扩展的拉丁字母,比如一些重音字母,带音标的字母等,ISO/IEC 8859 主要是在 ASCII 的基础上增加了这些衍生的拉丁字母。
Shift_Jis 日语字符集,包含了全角及半角拉丁字母、平假名、片假名、符号及日语汉字,1978 年首次发布。
Big5 繁体中文字符集,1984 年发布,通行于台湾、香港等地区,收录了 13053 个中文字、408个普通字符以及 33 个控制字符。
GB2312 简体中文字符集,1980 年发布,共收录了 6763 个汉字,其中一级汉字 3755 个,二级汉字 3008 个;同时收录了包括拉丁字母、希腊字母、日文平假名及片假名字母、俄语西里尔字母在内的 682 个字符。
GBK 中文字符集,是在 GB2312 的基础上进行的扩展,1995 年发布。

GB2312 收录的汉字虽然覆盖了中国大陆 99.75% 的使用频率,满足了基本的输入输出要求,但是对于人名、古汉语等方面出现的罕用字(例如朱镕基的“镕”就没有被 GB2312 收录),GB2312 并不能处理,所以后来又对 GBK 进行了一次扩展,形成了一种新的字符集,就是 GBK。

GBK 共收录了 21886 个汉字和图形符号,包括 GB2312 中的全部汉字、非汉字符号,以及 BIG5 中的全部繁体字,还有一些生僻字。
GB18030 中文字符集,是对 GBK 和 GB2312 的又一次扩展,2000 年发布。

GB18030 共收录 70244 个汉字,支持中国国内少数民族的文字,以及日语韩语中的汉字。
由于 ASCII 先入为主,已经使用了十来年了,现有的很多软件和文档都是基于 ASCII 的,所以后来的这些字符编码都是在 ASCII 基础上进行的扩展,它们都兼容 ASCII,以支持既有的软件和文档。

兼容 ASCII 的含义是,原来 ASCII 中已经包含的字符,在国家编码(地区编码)中的位置不变(也就是编码值不变),只是在这些字符的后面增添了新的字符。

如何存储

标准 ASCII 编码共包含了 128 个字符,用一个字节就足以存储(实际上是用一个字节中较低的 7 位来存储),而日文、中文、韩文等包含的字符非常多,有成千上万个,一个字节肯定是不够的(一个字节最多存储 2⁸ = 256 个字符),所以要进行扩展,用两个、三个甚至四个字节来表示。

在制定字符编码时还要考虑内存利用率的问题。我们经常使用的字符,其编码值一般都比较小,例如字母和数字都是 ASCII 编码,其编码值不会超过 127,用一个字节存储足以,如果硬要用多个字节存储,就会浪费很多内存空间。

为了达到「既能存储本国字符,又能节省内存」的目的,Shift-Jis、Big5、GB2312 等都采用变长的编码方式:
总起来说,越常用的字符占用的内存越少,越罕见的字符占用的内存越多。

具体讲一下中文编码方案

GB2312 --> GBK --> GB18030 是中文编码的三套方案,出现的时间从早到晚,收录的字符数目依次增加,并且向下兼容。GB2312 和 GBK 收录的字符数目较少,用 1~2 个字节存储;GB18030 收录的字符最多,用 1、2、4 个字节存储。

1) 从整体上讲,GB2312 和 GBK 的编码方式一致,具体为:
例如对于字母A,它在内存中存储为 01000001;对于汉字中,它在内存中存储为 11010110  11010000。由于单字节和双字节的最高位不一样,所以字符处理软件很容易区分一个字符到底用了几个字节。

2) GB18030 为了容纳更多的字符,并且要区分两个字节和四个字节,所以修改了编码方案,具体为:

例如对于字母A,它在内存中存储为 01000001;对于汉字中,它在内存中存储为 11010110  11010000;对于藏文གྱུ,它在内存中的存储为 10000001  00110010  11101111  00110000。

字符处理软件在处理文本时,从左往右依次扫描每个字节:
可见,当字符占用两个或者四个字节时,GB18030 编码要检测两次,处理效率比 GB2312 和 GBK 都低。

GBK 编码最牛掰

GBK 于 1995 年发布,这一年也是互联网爆发的元年,国人使用电脑越来越多,也许是 GBK 这头猪正好站在风口上,它就飞起来了,后来的中文版 Windows 都将 GBK 作为默认的中文编码方案。

注意,这里我说 GBK 是默认的中文编码方案,并没有说 Windows 默认支持 GBK。Windows 在内核层面使用的是 Unicode 字符集(严格来说是 UTF-16 编码),但是它也给用户留出了选择的余地,如果用户不希望使用 Unicode,而是希望使用中文编码方案,那么这个时候 Windows 默认使用 GBK(当然,你可以选择使用 GB2312 或者 GB18030,不过一般没有这个必要)。
下节我们会讲解 Unicode 字符集和 UTF-16 编码方案。
实际上,中文版 Windows 下的很多程序默认使用的就是 GBK 编码,例如用记事本程序创建一个 txt 文档、在 cmd 或者控制台程序(最常见的 C 语言程序)中显示汉字、用 Visual Studio 创建的源文件等,使用的都是 GBK 编码。

可以说,GBK 编码在中文版的 Windows 中大行其道。

意见反馈

微信二维码 微信扫码关注 抖音二维码 抖音扫码关注