python切分TXT的句子到Excel(复制可用)——以及python切分句子遇到的问题汇总
创始人
2024-01-26 02:06:57

文章目录

  • 完整代码
  • 时间转化和提取
  • 各种对象类型转换
  • 时间序列
  • 类属性
  • 数据转换

完整代码

import jieba.analyseimport jieba.posseg as pseg
from wordcloud import WordCloud
import xlsxwriter
# encoding=gbk
import xlsxwriterf = open('E:/data/xieyangteng/review.txt', 'r', encoding='utf-8')
s = f.read()
print(type(s))# print(s)
def cut_sentences(content):  # 实现分句的函数,content参数是传入的文本字符串# 这个结束符号可以加中文的 ,   但是暂时没有加end_flag = ['?', '!', '.', '?', '!', '。']  # 结束符号,包含中文和英文的content_len = len(content)sentences = []  # 存储每一个句子的列表tmp_char = ''for idx, char in enumerate(content):tmp_char += char  # 拼接字符if (idx + 1) == content_len:  # 判断是否已经到了最后一位sentences.append(tmp_char.strip().replace('\ufeff', ''))breakif char in end_flag:  # 判断此字符是否为结束符号# 再判断下一个字符是否为结束符号,如果不是结束符号,则切分句子next_idx = idx + 1if not content[next_idx] in end_flag:sentences.append(tmp_char.strip().replace('\ufeff', ''))tmp_char = ''return sentences  # 函数返回一个包含分割后的每一个完整句子的列表sentence_list = cut_sentences(s)# 导入Excel
# 一:创建工作簿
workbook = xlsxwriter.Workbook('xieyangteng.xlsx')  # 创建一个excel文件# 二:创建工作表
worksheet1 = workbook.add_worksheet('test-sheet1')  # 在文件中创建一个名为test-sheet1的sheet,不加名字默认为sheet1
worksheet2 = workbook.add_worksheet()  # Sheet2
worksheet3 = workbook.add_worksheet('test-sheet2')
worksheet4 = workbook.add_worksheet()  # Sheet4# 三:设置单元格的值worksheet1.write('A1', '对话语句')  # 在A1单元格写上语句
worksheet1.write('B1', '分类的类别')  # 在B1单元格写上要分类的label# 使用行列方式,下标从0开始
j = 1
for i in sentence_list:worksheet1.write(j, 0, i)  # 第3行第1列(即A3) 写入100worksheet1.set_column(j, 0, 120)worksheet1.set_column(j, 1, 20)print("success!")j += 1workbook.close()

时间转化和提取

00:01:30,050 --> 00:01:44,280
这样一个字符串,如何提取出时间序列。
泪目终于找到我要的代码了开心哭了。

这一串是正则匹配时间提取的核心技术。

各种对象类型转换

参考这个
在这里插入图片描述

时间序列

现在成功切分出了
start time 和 end time
start time 00:00:00
end time 00:00:02
格式是这个样子的,
但是 如何计算
参考正则匹配时间序列:
可以学学人家的代码写作思路。

类属性

初始化属性和不初始化属性的区别,
可以在这篇博客 体会一下

数据转换

提取的转为时间的字符串,保存为float 保留

a = 12.3456
a1 = round(a,2) # 保留小数点后两位
a2 = round(a,3) # 保留小数点后三位
print(a1)
print(a2)

时间分开合并的时候有报错

int() argument must be a string, a bytes-like object or a number, not 'built

我这打印过了 都是 str类型00:00:00
分了三个 每个都是str类型
先转成 int()之后在计算,成功解决!

相关内容

热门资讯

北京的名胜古迹 北京最著名的景... 北京从元代开始,逐渐走上帝国首都的道路,先是成为大辽朝五大首都之一的南京城,随着金灭辽,金代从海陵王...
埃菲尔铁塔在哪 中国仿建埃菲尔... 2019年4月26日,广西南宁市,街头惊现一座巨型山寨版埃菲尔铁塔,高约20米,白色塔身,造型逼真,...
插入行快捷键 excel添加空... 如下图所示,像这样在两行之间插入多行空白行的操作,你会几种?可能很多人都会觉得,不就是插入空行嘛,简...
苗族的传统节日 贵州苗族节日有... 【岜沙苗族芦笙节】岜沙,苗语叫“分送”,距从江县城7.5公里,是世界上最崇拜树木并以树为神的枪手部落...
应用未安装解决办法 平板应用未... ---IT小技术,每天Get一个小技能!一、前言描述苹果IPad2居然不能安装怎么办?与此IPad不...
脚上的穴位图 脚面经络图对应的... 人体穴位作用图解大全更清晰直观的标注了各个人体穴位的作用,包括头部穴位图、胸部穴位图、背部穴位图、胳...
长白山自助游攻略 吉林长白山游... 昨天介绍了西坡的景点详细请看链接:一个人的旅行,据说能看到长白山天池全凭运气,您的运气如何?今日介绍...
猫咪吃了塑料袋怎么办 猫咪误食... 你知道吗?塑料袋放久了会长猫哦!要说猫咪对塑料袋的喜爱程度完完全全可以媲美纸箱家里只要一有塑料袋的响...
世界上最漂亮的人 世界上最漂亮... 此前在某网上,选出了全球265万颜值姣好的女性。从这些数量庞大的女性群体中,人们投票选出了心目中最美...
埃菲尔铁塔在哪 中国仿建埃菲尔... 2019年4月26日,广西南宁市,街头惊现一座巨型山寨版埃菲尔铁塔,高约20米,白色塔身,造型逼真,...
苗族的传统节日 贵州苗族节日有... 【岜沙苗族芦笙节】岜沙,苗语叫“分送”,距从江县城7.5公里,是世界上最崇拜树木并以树为神的枪手部落...
疑难件什么意思 淘宝退货为什么... 01 常见售后类型对于现在主流电商来说,通常支持的售后形式包括仅退款,退货退款,换货,补寄。用户根据...
北京的名胜古迹 北京最著名的景... 北京从元代开始,逐渐走上帝国首都的道路,先是成为大辽朝五大首都之一的南京城,随着金灭辽,金代从海陵王...