搜索

C语言教程

编程基础

通俗地理解什么是编程语言 C 语言究竟是一门怎样的语言? C 语言和 C++ 到底有什么关系? 学了 C 语言到底能做什么,能从事什么工作? 二进制、八进制和十六进制 不同进制之间的转换 数据在内存中的存储 载入内存,让程序运行起来 ASCII 编码,将英文存储到计算机 GB2312 编码和 GBK 编码,将中文存储到计算机 Unicode 字符集,将全世界的文字存储到计算机 程序员的薪水和发展方向大全 不要这样学习 C 语言,这是一个坑! 明白了这点才能学好编程,否则参加什么培训班都没用

C 语言初探

第一个 C 语言程序 选择正确的输入法,严格区分中英文 什么是源文件? 什么是编译和链接? 主流 C 语言编译器有哪些? 什么是 IDE(集成开发环境)? 什么是工程/项目? 哪款 C 语言编译器(IDE)适合初学者? 如何在手机上编写 C 语言代码? C 语言的三套标准:C89、C99 和 C11 C 语言为什么有那么多编译器? 程序安装是怎么回事? 制作安装包,让用户安装程序 C 语言程序的错误和警告 分析第一个 C 语言程序 C 语言代码中的空白符 彩色版的 C 语言,让文字更漂亮 一个真正带界面的 C 语言程序

变量和数据类型

大话 C 语言变量和数据类型 在屏幕上输出各种类型的数据 C 语言中的整数(short,int,long) 二进制数、八进制数和十六进制数 C 语言中的正负数及其输出 整数在内存中是如何存储的,为什么它堪称天才般的设计 整数的取值范围以及数值溢出 C 语言中的小数(float,double) 小数在内存中是如何存储的,揭秘诺贝尔奖级别的设计(长篇神文) 在 C 语言中使用英文字符 在 C 语言中使用中文字符 C 语言到底使用什么编码?谁说 C 语言使用 ASCII 码,真是荒谬! C 语言转义字符 C 语言中的几个重要概念 C 语言加减乘除运算 C 语言自增(++) 和自减(--) 变量的定义位置以及初始值 运算符的优先级和结合性 C 语言数据类型转换

C 语言输入输出

数据输出大汇总以及轻量进阶 在屏幕的任意位置输出字符,开发小游戏的第一步 使用 scanf 读取从键盘输入的数据 从键盘输入字符和字符串 进入缓冲区(缓存)的世界,破解一切与输入输出有关的疑难杂症 结合缓冲区谈 scanf 函数,那些奇怪的行为其实都有章可循 清空(刷新)缓冲区,从根本上消除那些奇怪的行为 scanf 的高级用法,原来 scanf 还有这么多新技能 C 语言模拟密码输入(显示星号 ) 非阻塞式键盘监听,用户不输入数据程序也能继续执行

循环结构和选择结构

else 语句 C 语言关系运算符 C 语言逻辑运算符 case 语句 C 语言条件运算符 C 语言 while 循环 C 语言 for 循环 C 语言跳出循环 C 语言循环嵌套 对选择结构和循环结构的总结 谈编程思维的培养,初学者如何实现自我突破(非常重要) 写一个内存泄露的例子,让计算机内存爆满

C 语言数组

什么是数组 C 语言二维数组 判断数组中是否包含某个元素 C 语言字符数组和字符串 字符串的输入和输出 C 语言字符串处理函数 C 语言数组是静态的,不能插入或删除元素 C 语言数组的越界和溢出 C 语言变长数组:使用变量指明数组的长度 对数组元素进行排序 对 C 语言数组的总结

C 语言函数

什么是函数? C 语言函数定义 C 语言函数的形参和实参 C 语言函数的返回值 C 语言函数的调用(从中发现程序运行的秘密) 函数声明以及函数原型 全局变量和局部变量 C 语言变量的作用域 C 语言块级变量 C 语言递归函数(带实例演示) 中间递归函数(比较复杂的一种递归) 多层递归函数(最烧脑的一种递归) 递归函数的致命缺陷:巨大的时间开销和内存开销(附带优化方案) 忽略语法细节,从整体上理解函数

预处理命令

什么是预处理命令? #include 的用法 C 语言宏定义 C 语言带参数的宏定义 带参宏定义和函数的区别 宏参数的字符串化和宏参数的连接 C 语言中几个预定义宏 C 语言条件编译 #error 命令,阻止程序编译 C 语言预处理命令总结

指针

1 分钟彻底理解指针的概念 指针变量的定义和使用 C 语言指针变量的运算 数组指针(指向数组的指针) 字符串指针(指向字符串的指针) C 语言数组灵活多变的访问形式 指针变量作为函数参数 C 语言指针作为函数返回值 二级指针(指向指针的指针) 空指针 NULL 以及 void 指针 数组和指针绝不等价,数组是另外一种类型 数组到底在什么时候会转换为指针 指针数组(数组每个元素都是指针) 一道题目玩转指针数组和二级指针 二维数组指针(指向二维数组的指针) 函数指针(指向函数的指针) 只需一招,彻底攻克 C 语言指针,再复杂的指针都不怕 main() 函数的高级用法:接收用户输入的数据 对 C 语言指针的总结

结构体

C 语言结构体 C 语言结构体数组 C 语言结构体指针 C 语言枚举类型 C 语言共用体 大端小端以及判别方式 C 语言位域 C 语言位运算 使用位运算对数据或文件内容进行加密

重要知识点补充

typedef 的用法 const 的用法 C 语言随机数

文件操作

C 语言中的文件是什么? C 语言打开文件 文本文件和二进制文件到底有什么区别? 以字符形式读写文件 以字符串的形式读写文件 以数据块的形式读写文件 格式化读写文件 随机读写文件 C 语言实现文件复制功能 FILE 结构体以及缓冲区深入探讨 获取文件大小(长度) 插入、删除、更改文件内容

C 语言调试

调试的概念以及调试器的选择 设置断点,开始调试 查看和修改变量的值 单步调试(逐语句调试和逐过程调试) 即时窗口的使用 查看、修改运行时的内存 有条件断点的设置 assert 断言函数 调试信息的输出 VS 调试的总结以及技巧

C 语言到底使用什么编码?谁说 C 语言使用 ASCII 码,真是荒谬!

C 语言是 70 年代的产物,那个时候只有 ASCII,各个国家的字符编码都还未成熟,所以 C 语言不可能从底层支持 GB2312、GBK、Big5、Shift-JIS 等国家编码,也不可能支持 Unicode 字符集。

稍微有点 C 语言基本功的读者可能认为 C 语言使用 ASCII 编码,字符在存储时会转换成对应的 ASCII 码值,这也是错误的,你被大学老师和教材误导了!在 C 语言中,只有 char 类型的窄字符才使用 ASCII 编码,char 类型的窄字符串、wchar_t 类型的宽字符和宽字符串都不使用 ASCII 编码!

wchar_t 类型的宽字符和宽字符串使用 UTF-16 或者 UTF-32 编码,这个在上节已经讲到了,现在只剩下 char 类型的窄字符串(下面称为窄字符串)没有讲了,这就是本节的重点。

对于窄字符串,C 语言并没有规定使用哪一种特定的编码,只要选用的编码能够适应当前的环境即可,所以,窄字符串的编码与操作系统和编译器有关。

但是,可以肯定的说,在现代计算机中,窄字符串已经不再使用 ASCII 编码了,因为 ASCII 编码只能显示字母、数字等英文字符,对汉语、日语、韩语等其它地区的字符无能为力。

讨论窄字符串的编码要从以下两个方面下手。

源文件使用什么编码

源文件用来保存我们编写的代码,它最终会被存储到本地硬盘,或者远程服务器,这个时候就要尽量压缩文件体积,以节省硬盘空间或者网络流量,而代码中大部分的字符都是 ASCII 编码中的字符,用一个字节足以容纳,所以 UTF-8 编码是一个不错的选择。

UTF-8 兼容 ASCII,代码中的大部分字符可以用一个字节保存;另外 UTF-8 基于 Unicode,支持全世界的字符,我们编写的代码可以给全球的程序员使用,真正做到技术无国界。

常见的 IDE 或者编辑器,例如 Xcode、Sublime Text、Gedit、Vim 等,在创建源文件时一般也默认使用 UTF-8 编码。但是 Visual Studio 是个奇葩,它默认使用本地编码来创建源文件。
所谓本地编码,就是像 GBK、Big5、Shift-JIS 等这样的国家编码(地区编码);针对不同国家发行的操作系统,默认的本地编码一般不同。简体中文本的 Windows 默认的本地编码是 GBK。
对于编译器来说,它往往支持多种编码格式的源文件。微软编译器、GCC、LLVM/Clang(内嵌于 Xcode 中)都支持 UTF-8 和本地编码的源文件,不过微软编译器还支持 UTF-16 编码的源文件。如果考虑到源文件的通用性,就只能使用 UTF-8 和本地编码了。

窄字符串使用什么编码

前面讲到,用 puts 或者 printf 可以输出窄字符串,代码如下:
#include <stdio.h>
int main()
{
    puts("toolhelper.cn");
    printf("http://c.biancheng.net");
    return 0;
}
"toolhelper.cn"和"http://c.biancheng.net"就是需要被处理的窄字符串,程序运行后,它们会被载入到内存中。你看,这里面还包含了中文,肯定不能使用 ASCII 编码了。

1) 微软编译器使用本地编码来保存这些字符。不同地区的 Windows 版本默认的本地编码不一样,所以,同样的窄字符串在不同的 Windows 版本下使用的编码也不一样。对于简体中文版的 Windows,使用的是 GBK 编码。

2) GCC、LLVM/Clang 编译器使用和源文件相同的编码来保存这些字符:如果源文件使用的是 UTF-8 编码,那么这些字符也使用 UTF-8 编码;如果源文件使用的是 GBK 编码,那么这些字符也使用 GBK 编码。

你看,对于代码中需要被处理的窄字符串,不同的编译器差别还是挺大的。不过可以肯定的是,这些字符始终都使用窄字符(多字节字符)编码。

正是由于这些字符使用 UTF-8、GBK 等编码,而不是使用 ASCII 编码,所以它们才能包含中文。

那么,为什么很多初学者会误认为 C 语言使用 ASCII 编码呢?

不管是在课堂跟着老师学习,还是通过互联网自学,初学者都是从处理英文开始的,对于英文来说,使用 GBK、UTF-8、ASCII 都是一样的,GBK、UTF-8 都兼容 ASCII,初学者根本察觉不出用了哪种编码。

另外,很多大学老师和书籍作者也经常会念叨,字符在存储时会被转换成对应的 ASCII 码,在读取时又会从 ASCII 码转换成对应的字符实体,大家需要熟悉 ASCII 编码,它是 C 语言处理字符的基础,这从很大程度上给初学者造成一种错误印象:C 语言和 ASCII 编码是绑定的,C 语言使用 ASCII 编码。

总结

对于 char 类型的窄字符,始终使用 ASCII 编码。

对于 wchar_t 类型的宽字符和宽字符串,使用 UTF-16 或者 UTF-32 编码,它们都是基于 Unicode 字符集的。

对于 char 类型的窄字符串,微软编译器使用本地编码,GCC、LLVM/Clang 使用和源文件编码相同的编码。

另外,处理窄字符和处理宽字符使用的函数也不一样:
你看,仅仅是字符的处理,C 语言就能玩出这么多花样,让人捉摸不透,不容易学习。这是因为,C 语言是一种较为底层和古老的语言,既有历史遗留问题,又有贴近计算机底层的特性。不过,一旦搞明白这些繁杂的底层问题,你的编程内功将精进一个层次,这也许就是学习 C 语言的乐趣。

【拓展】编码字符集和运行字符集

站在专业的角度讲,源文件使用的字符集被称为编码字符集,也就是写代码的时候使用的字符集;程序中的字符或者字符串使用的字符集被称为运行字符集,也就是程序运行后使用的字符集。

源文件需要保存到硬盘,或者在网络上传输,使用的编码要尽量节省存储空间,同时要方便跨国交流,所以一般使用 UTF-8,这就是选择编码字符集的标准。

程序中的字符或者字符串,在程序运行后必须被载入到内存,才能进行后续的处理,对于这些字符来说,要尽量选用能够提高处理速度的编码,例如 UTF-16 和 UTF-32 编码就能够快速定位(查找)字符。

编码字符集是站在存储和传输的角度,运行字符集是站在处理或者操作的角度,所以它们并不一定相同。

意见反馈

微信二维码 微信扫码关注 抖音二维码 抖音扫码关注