教育部:《通用规范汉字表》问题解答(二)
http://www.edu.cn/hzb_8413/20090820/t20 ... 0832.shtml
2009-08-20 《通用规范汉字表》研制专家工作组
6.《通用规范汉字表》三级字表设立的原因及其性质
《通用规范汉字表》三级字表的设立,主要是为了满足专门领域的用字在通用层面上的需要。由于信息化带来的用字量扩大,《通用规范汉字表》如果只局限在基本通用字的范围,虽然可以满足日常生活用字的需要,却无法解决计算机存储和专门领域的用字问题。因此,有必要补充一些与大众生活密切相关的专门领域用字。《通用规范汉字表》在基本通用字之外,增设三级字表,适当增加姓氏人名用字、地名用字、科技术语用字以及中小学教材文言文用字,以便有效地解决这四个领域中信息处理的缺字问题。
虽然三级字不能在平衡语料库里依照字频和覆盖率收集到,但仍旧属于通用层面上的用字。这个问题需要从两个方面解释:
第一,需要全面理解“通用”这个概念。“通用”包括两个层面:一个是印刷的层面,一个是阅读的层面。能够进入平衡语料库的汉字,兼有这两个方面的通行度。但是也有一些汉字,印刷的频度并不高,阅读的频度却很高。例如医药名称、饮食营养学中的专业用字,虽然仅仅专业领域用来打印,但阅读人群却可以达到千家万户。再如,基础教育语文教材的文言用字,也有少部分不属于社会通用字,但是每年的教材印刷必须使用,历届教师、学生、家长必须面对,阅读人群几乎也达到千家万户。这些字也是需要统一字形而进入规范的。
第二,在信息时代,“通用”的概念发生了实质性的变化。除了人的使用外,还必须考虑到计算机的存储与使用。在汉字主要是手写的时代,这些特定领域的用字即使不定标准也不会有太大的问题,而在计算机和互联网时代,那些在一般语料库里凭借字频难以找到的字,在人民的日常生活中却不失其通用性。以汉字为载体的信息,一部分是在流通领域通行的,还有一部分是储备领域必需的。例如姓名,除了知名人士,一般的姓名在社会通用层面上使用度不会太高;地名,除了大城市、著名景点,一般的地名在社会通用层面上使用度也比较有限,根据字频和使用度不能将它们收集到。但是,无所不往的邮政、金融、交通等事业,无人不用的身份证、学历证书、医疗保险、产权证明等证件,必须储备可能用到的汉字。如果在信息处理上不对这些字进行规范,也会引起社会信息储备和使用的混乱。完全依据使用频率和语料覆盖率来确定字表的收字,这些特定领域的用字就难以收集到,所以要从专门领域提供的专用字中收集。专业领域通用字是对一般社会通用字的必不可少的补充。
7.《通用规范汉字表》三级字表的收字原则、范围以及具体来源
在确定《通用规范汉字表》三级字表的收字时,坚持以下三条原则:(1)从汉字应用的具体事实出发,必须字字有来历,或有文献出处,或由相关职能部门提供用例和出处;(2)必须音义俱全,人名用字应适合于起名;(3)必须保证其通用的性质,不收用处不大的生僻字。收字范围具体包括:姓氏人名用字、地名用字、科技术语用字、中小学教材文言文用字。
(1)姓氏人名用字。中国是一个多民族的国家,姓氏不但稽留着民族和血缘的传承关系,还成为每个公民的称谓符号,其用字不能随便更改。字表对当用的姓氏用字要尽可能收集齐全,以保证信息传播的信度。至于名字所用的汉字,现在已经相当混乱,有些名字的用字甚至在已经扩充到7万余字的计算机国际编码字符集中都难以找到,致使第二代身份证由于字库用字不全而无法制作,给一些人的生活带来极大不便。《通用规范汉字表》无法改变已有人名用字的混乱状况和使用上的麻烦,但可以对今后的命名(主要是新生儿起名)和更名提供一些便于使用的字,可以引导人们减少使用生僻字、避免使用错讹字起名。这就需要尽量将姓氏用字收全,并在已有的人名用字中选择足够的、适合于起名的汉字进行规范,以保证个人姓名有效地在社会上流通。
(2)地名用字。地名用字往往不是在全国范围内普遍通行,但对当地居民来说却属于常用字,在省级区划范围内,乡以上地名用字是不可缺少的。由于方言的关系,经常会产生各种各样的“方言字”或自造字,造成用字的混乱。当今,户籍、邮政、金融等行业的信息贮存和检索已经全面数字化,地球卫星定位系统广泛应用,地名用字的混乱,会给有关行业带来信息阻塞的后果,这是不言自明的。
(3)科技术语用字。由于科学技术的发展、教育水平的提高和科学知识的普及,很多科学技术的用语快速进入人民的日常生活。仅仅拿记录化学元素的汉字来说,它们很多要用在药品名上,当药方不再手写而用计算机输录时,这些字就成为医生、药师、病人、家属交流的载体。农药、化肥、室内装修材料也有不少是要用它们的学名来宣传、普及的。至于化妆品、清洁剂的使用,饮食健康的讲解,气象的采集和预报等,一旦进入科学普及领域,都会受到普遍关注。特别是各专业的教科书的编写和印刷,更会用到这些字。
(4)中小学教材文言文用字。规范汉字主要是书写现代汉语文本的,但是,传统、历史与现代不是绝缘的,现代文本中会引用文言作品,中小学语文教材中也都会收一部分优秀的文言作品。前者可以在一般的平衡语料库中收集到,而为了保证教材印刷的规范,需要在语文教材中专门收集文言文的用字。
这四个方面,既是信息时代用字的重要领域,又是信息传播容易缺字的领域。具体收字数量如下:
姓氏人名用字930字,主要来源于1982年18省市抽样人口普查资料和公安部提供的姓氏用字及部分人名用字,并适当补收一些古代姓氏用字和有影响的古代人名用字。
地名用字465字,主要来源于民政部提供的乡镇以上地名用字、国家测绘局提供的部分村级地名和部分自然实体名称的用字、常用汉语工具书中标明为“地名”的用字。
科技术语用字276字,主要来源于全国科学技术名词审定委员会提供的中医药学、植物学、遗传学、冶金学、微生物学、土壤学等56个门类的术语用字,以及中国社会科学院语言研究所提供的天文、气象、地理、动物、植物、工业、农业、政治、经济、文化、历史等33个门类的科学技术与人文社会科学的术语用字。
中小学教材的文言文用字362字,主要从字表研制工作组建立的“中小学语文教材文言文语料库”(收1949-2007年中小学语文及普及文言文语料,560万汉字)中提取。
以上四个方面的用字合并去重后,去除已经进入一、二级字表的字,再去除疑难字、错讹字和异体字等,共为1800字。由于三级字是四个方面的用字合并去重后得出的,所以,三级字的属性并不都是单一的,有些字可能兼有多个领域的不同属性。
8.《通用规范汉字表》对异体字问题的处理
严格异体字的定义应当是:音义全同、记词职能完全一样、仅仅字形不同,它们在任何语境下都能互相替代而不影响表达的意义的一组字。可以看出,从功能来看,异体字是汉字的冗余,徒增记忆的负担,需要加以规范。1955年12月22日发布的《第一批异体字整理表》的说明中指出:“从实施日起,全国出版的报纸、杂志、图书一律停止使用表中括号内的异体字。但翻印古书须用原文原字的,可作例外。”这个说明明确了异体字属于“不规范的字”的范围,异体字在通用层面上书写现代汉语文本时,不能使用。但是,在该异体字整理表中确定的“异体字”,有些并不是严格意义上的异体字。把这些字都列入“不规范的字”的范围而取消,有时不利于意义的精确表达。
《通用规范汉字表》对《第一批异体字整理表》进行整理时,采用了科学的原则、稳定的原则和求实的原则,形音义并重,对各组字的关系进行了重新认定,并规定今后对这类字,不再采用简单的“取消”“废除”而要采取“认同”和“辨析”的处理方法。
《第一批异体字整理表》在1955年12月发布后,有些相关的文件曾对其进行过改动,主要是:(1)1956年3月发布的《修正〈第一批异体字整理表〉内“阪”“挫”二字的通知》;(2)《简化字总表》(1986年10月10日重新发表)和《关于发布〈现代汉语通用字表〉的联合通知》(1988年3月25日发布)中重新认定了26个字;(3)1993年《关于“镕”字使用问题的批复》。上述3个文件总共恢复了29字,分别是:阪、挫、、、晔、詟、诃、、、刬、鲙、诓、雠、翦、邱、於、澹、骼、彷、菰、溷、徼、熏、黏、桉、愣、晖、凋、镕。此次制定《新订异体字整理表》时,根据现有原则对这29个字重新审核,审核后的处理结果为:“ 、、、刬”4字仍按异体字处理,其余25字收入《通用规范汉字表》。此外,根据群众的意见,《通用规范汉字表》还将51个异体字恢复为规范字,并在各级字表中相应的字下增加注释,说明这些字恢复为规范字后的使用范围:
恢复到二级字表中共6字,其中只恢复其部分音项的1字,即“袷”;完全恢复不再作为异体字的5字,分别是“噘、慄、蹚、皙、瞋”。
恢复到三级字表中共45字,其中只恢复其部分音项的5字,分别是氾、、叚、絜、釐;恢复其部分义项的36字,分别是仝、邨、扞、吒、飏、昇、並、迳、迺、钜、祕、陞、、桠、赀、、脩、砦、堃、喆、蒐、椀、甦、淼、犇、殽、、甯、缐、劄、、麹、谿、瓌、、龢;完全恢复不再作为异体字的4字,分别是凓、勠、菉、曏。
9.《通用规范汉字表》对类推简化问题的处理
1964年5月,中国文字改革委员会根据当年3月文改会、文化部、教育部联合发布的《关于简化字的联合通知》而编印出版了《简化字总表》,在《〈简化字总表〉说明》中有这样的表述:“本表收录1956年国务院公布的《汉字简化方案》中的全部简化字。关于简化偏旁的应用范围,本表遵照1956年方案中的规定以及1964年3月7日中国文字改革委员会、文化部、教育部《关于简化字的联合通知》的规定,用简化字和简化偏旁作为偏旁得出来的简化字,也收录本表内。”“用简化字和简化偏旁作为偏旁得出来的简化字”就是类推简化,比如“嚴”“龍”简化为“严”“龙”,“儼”“壟”可以类推简化为“俨”“垄”;“車”简化为“车”,则以“車”为偏旁的“軌、軍、庫、載”可以类推简化为“轨、军、库、载”,等等。《〈简化字总表〉说明》还列出了132个可作偏旁用的简化字和14个简化偏旁,作为类推简化的依据。这132个简化字和14个不能独用的偏旁,可以用在当时《新华字典》所收8000多个汉字的范围内没有简化的字上,这些字形成了《简化字总表》的第三表,一共收字1753个, 它们都是类推简化来的简化字。虽然文件中没有明确规定这种类推简化的范围,但实际上只应用于当时最常见的汉语工具书《新华字典》的收字范围内,所以被称作“有限类推”。
实行类推的初衷是为了保持简化汉字的系统,易于识别;总体减少笔画,书写方便。这个原则在有限的范围内进行,对保持汉字构形的体系不能说没有积极的作用。但是,由于类推简化没有明确限制范围,当一系列大中型字词书相继问世、大型计算机字库相继建立、简体版的古籍纷纷出版时,类推简化的范围便无限扩大,远远超出了原来的《新华字典》8000个字的范围,问题也就逐渐显露:字数大量增多后,产生了一批同形字;有些繁体字类推简化后,原字的结构被破坏,影响了构字的理据,也破坏了字形的美观;类推出了一大批完全没有使用过的字形,实际上使汉字的总体系统繁化甚至混乱;有些辞书对贮存领域的汉字不限部位、不限层次、不限功能地无限类推,在汉字本来数量繁多的情况下,又人为地造出大量历史上从来没有使用过的“人造字”,违背了辞书存储汉字的历史真实性原则;造成了一个新的“简化系统”,拉大了汉字应用的古今距离和两岸距离。
《通用规范汉字表》对类推简化采用了尊重现实和严格限制的原则。所谓尊重现实,是对在《现代汉语通用字表》范围内已经有限类推的字仍然保留。由于姓氏人名、科技用字和用简化字印刷的语文课本中的文言文用字多数也已经类推,因此,三级字表也采用有限类推的办法,实行类推简化,与一、二级字表保持一致。其具体细则是:(1)按《简化字总表》第二表规定的132字与14个偏旁的范围类推,不扩大范围。(2)尽量只在第一层次构字时类推,以保持原字的结构不受影响。(3)采用以上原则产生难以识别的怪异字或产生同形字时,为保持字与字的区别,作个别变通处理。不予类推简化。
《通用规范汉字表》以外的字,根据国务院1986年“今后,对汉字的简化应持谨慎态度,使汉字的形体在一个时期内保持相对稳定”的指示精神,不再类推简化;个别领域确需类推简化的,需报国家语言文字工作主管部门批准。
10.《通用规范汉字表》对宋体字形调整的原则与结果
《通用规范汉字表》对宋体字的字形进行了微调,主要是取得宋体字笔形变异上的一致。其他主用字体(仿宋体、黑体、楷体)与非主用字体,以后再逐步进行调整。
1965年发布的《印刷通用汉字字形表》,对宋体字的字形进行了有规则的处理,1988年发布的《现代汉语通用字表》继承了其字形规定。但其中还有少部分字,在同样条件下笔形变异处理不一致。这次制定《通用规范汉字表》,根据群众和专家意见,按照字形处理原则,对所收《印刷通用汉字字形表》的字进行了微调,也对新收的字进行了统一处理。
字形调整需要制定一些统一的规则,这样,借此次字形调整,检验、总结和完善过去已经建立的规则,以便在今后扩大字量时仍然有章可循,不再出现新的字形不统一现象。这次字形调整的总原则是:
①尊重汉字结构:字形调整虽是笔形层面的问题,但笔形的变异也会影响汉字的结构;在规定笔形变异规则时,必须尊重汉字结构,不因笔形调整使字的结构模式发生错乱或因调整笔形产生同形字、易混字等。
②考虑宋体风格:宋体字来源于雕版印刷字体,经过工艺美术处理,其笔形及笔画交接有自身的特点,总体风格讲求平直方正、对称均衡。新的《通用规范汉字表》的宋体字字形,应尽量符合宋体字的风格特点。
③遵循统一规则:调整字体,必须遵循统一规则。一切规则是在条件的控制下确立的,为了减少随意性,条件相同的字应按统一规则处理,条件有变化时规则才能变化。印刷字形的美化属于工艺美术层面,也应考虑规则的一致性。
④严格控制特例:在按规则处理字形时,会出现一些特殊情况,完全不允许对个别字进行特殊处理是很难做到的;但在处理特例时应阐明充分的理由,尽量减少规则之外的特殊处理字形。
在总的原则控制下,宋体字的笔画变异需要有进一步的理性规定。在这次字形调整中,制定了横变提,竖变撇,捺变点,竖弯钩变竖提,竖钩、横折钩去钩等五类笔形规则,这些规则是从原有字形规范中总结出来的,同时用来复查新的规范字是否符合这些规则。经过对字形的调整和美化,进一步取得了宋体字笔形的一致,使字形更趋于规律性、系统性。
《通用规范汉字表》以笔形变异规则为标准,对所收的8300字全部进行了复查,在统一笔形规则的前提下,生成了《通用规范汉字表》的宋体字形表,其中包括对《印刷通用汉字字形表》中与规则不一致的44个字的字形进行了调整,约占《印刷通用汉字字形表》总字数的0.57%。具体是:
①“琴、瑟、琵、琶”的上左和“徵”的中下部件“王”最后一笔横变提
②“魅”的右部件和“籴、汆、褰、衾”的下部件的末笔捺变点
③“巽(撰、馔、噀同)”的上左部件“巳”的最后一笔竖弯钩变竖提
④“亲(榇同)、杀(刹、脎、铩、弑同)、条(涤、绦、鲦同)、茶(搽同)、新(薪同)、杂、寨”下部件“木”的竖钩变竖
⑤“恿”的上部件和“瞥(弊、憋同)”的上左部件中横折钩变横折
⑥“蓐、溽、缛、褥、耨、薅”中的部件“”以及“唇、蜃”由半包围结构改为上下结构
⑦“毂”的左下部件“车”上添加一短横,与从“”诸字的字形取得一致。