木兰编程语言重现:完善函数功能,常用字拆分数据处理实例

为方便使用 Python 的标准库与第三方库,支持了函数调用时指定形参名的方式,比如下面代码第一行打开文件的encoding="utf-8":

木兰编程语言重现:完善函数功能,常用字拆分数据处理实例

与之相关,定义函数时可以指定形参默认值,也一并添加。

这段代码是为了获取常用汉字的拆字数据。源数据包括了几万汉字的信息比如:

U+4FC7	俇	⿰亻狂
U+4FC8	俈	⿰亻告
U+4FC9	俉	⿰亻吾
U+4FCA	俊	⿰亻夋 

首先写了个简单的常用字库,用以判断一个字是否属于常用的 2500 字(详见源码)。

上图的代码是过滤了源数据,只取出了常用字中,拆分出的部分也属于常用字的部分,并输出到 json 文件。比如:

    "圣": {
        "字型": "⿱",
        "部分": [
            "又",
            "土"
        ]
    },
    "地": {
        "字型": "⿰",
        "部分": [
            "土",
            "也"
        ]
    },

通过此段实例代码,验证了添加的函数功能,并发现了一些字符串转义处理上的问题并修复。

另外,将字典中无键的反馈信息中文化:

d = {1 : 'a', 3 : 'c'}
print(d[4]) 

反馈:

(..•˘_˘•..) 字典中不存在此键:4
见第2行:print(d[4]) 

代码统计

下面是几个主要部分的代码行数统计,格式为:上周->本周。


展开阅读全文

页面更新:2024-04-29

标签:木兰   常用字   函数   汉字   分析器   数据处理   功用   字型   字典   语法   实例   反馈   常用   代码   功能   测试   数据   科技   信息

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight 2020-2024 All Rights Reserved. Powered By 71396.com 闽ICP备11008920号-4
闽公网安备35020302034903号

Top