本发明涉及信息,尤其涉及基于云算力和大数据技术的知识图谱海量非结构化集成方法。
背景技术:
1、随着云计算和大数据技术的快速发展,获取和处理大量非结构化文本变得越来越重要。在音乐领域,获取和分析大量歌词或评论等非结构化文本,并将其应用于音乐制作和歌词创作,仍然是一个具有挑战性的问题。当前,许多音乐制作人和歌词作者仍然依赖于个人经验和直觉来制作音乐和歌词。他们需要从大量音乐数据中筛选与他们感兴趣的音乐元素或情感相关的信息。然而,由于音乐数据庞大且结构不明确,这一过程非常耗时且容易出错。因此,建立一个音乐知识图谱来支持音乐创作变得必要。建立音乐知识图谱需要大量的数据来支持,包括各种类型的音乐作品、音乐家的信息、音乐评论、音乐趋势等。这些数据可能分布在不同的来源和平台上,需要付出大量的时间和精力去收集、整理和清洗。同时,音乐中的歌词与评论为非结构化的数据,需要进行信息抽取和标注,这是一个既需要人力投入又需要精细操作的过程,需要大量的时间和资金支持。将非结构化的音乐数据转化为知识图谱涉及到实体识别、关系抽取等复杂任务。如何完成这些任务,并将其体现在知识图谱中,是一个挑战性的问题。因为知识图谱构建后,有大量的节点和子节点,会导致难以被创造者了解和简单使用,如何以降低知识图谱的复杂度,也是一个未解决的问题,它能给知识图谱的实用性带来突破。而且,音乐领域是一个快速变化的领域,需要定期更新音乐知识图谱以反映最新的音乐趋势和变化。同时,也需要对图谱进行维护,以保证其稳定性和可用性。然而,多次快速更新会导致音乐知识图谱庞大且难以应用。此外,音乐制作人和创作人往往拥有多个称呼,现有知识图谱往往难以对其进行合并处理,导致知识图谱过于庞大,且在分析歌手和创作人的偏好时可能会遗漏数据。另外,音乐知识图谱的知识是静态的,难以根据音乐制作人或歌词作者的个人风格提供个性化的修改建议。因此,音乐知识图谱在音乐创作和歌词修改方面的应用有一定局限性。
技术实现思路
1、本发明提供了基于云算力和大数据技术的知识图谱海量非结构化集成方法,主要包括:
2、利用云算力获取联通沃音乐的非结构化文本,包括评论、歌词,并用朴素贝叶斯算法进行初步分类;筛选出含有歌词或评论的文本,并运用情感分析模块进行情感打分;在云服务器对获取到的数据进行识别,筛选出与情感相关的歌词或音乐元素;形成情感标签-元素对,并将相似或相关的标签进行合并和统一,以降低知识图谱的复杂度;使用数据集成引擎将统一后的标签-元素对整合到一个简化的数据框架里;数据集成完成后,触发知识图谱的更新流程,并将这个简化的数据框架加入到音乐知识图谱中;实时检测机制同步更新数据集成框架中新加入的元素或标签,并在超出预定复杂度时自动触发标签的合并和简化;根据音乐知识图谱,通过决策树算法分析音乐制作人或歌词作者关注的旋律或歌词;根据决策树算法预测结果,结合音乐知识图谱生成歌词修改方案,以用于修改旋律或歌词。
3、在一种实施方式中,所述利用云算力获取联通沃音乐的非结构化文本,包括评论、歌词,并用朴素贝叶斯算法进行初步分类,包括:
4、使用云服务器通过公开的数据接口从联通沃音乐获取相关的非结构化文本数据,包括评论和歌词;对于获取到的非结构化文本数据,使用jieba进行预处理工作,包括去重、清洗、分词和词性标注;通过tf-idf,将文本转化为可供朴素贝叶斯算法使用的特征向量,特征向量包括文本内容和语义信息;使用文本特征向量对朴素贝叶斯算法进行训练,根据训练数据学习每个类别的特征分布;将经过预处理后的特征向量输入经训练的朴素贝叶斯算法,输出文本的分类结果,即预测的类别,根据需求,将这些文本分为情感正面、情感负面、与音乐相关的话题、与音乐无关的话题的类别。
5、在一种实施方式中,所述筛选出含有歌词或评论的文本,并运用情感分析模块进行情感打分,包括:
6、预先确定关键词或关键短语包括表示歌曲的名称、专辑、艺术家名字和歌词,使用关键词匹配的方法,对文本进行关键词的匹配检测;如果文本中包含任意一个关键词或短语,将该文本视为含有歌词或评论的文本;使用正则表达式或字符串匹配的方法,对文本进行精确或模糊匹配;对于匹配到的含有歌词或评论的文本,将其保留并记录下来,作为后续贝叶斯分类算法进行情感打分的输入;获取包含情感标签的训练数据集,包含文本样本和相应的情感标签正面、负面或中性情感;对文本样本进行预处理,包括文本清洗、分词、停用词去除;将预处理后的文本使用tf-idf转换为作为朴素贝叶斯算法输入的特征向量;将特征向量和相应的情感标签输入朴素贝叶斯分类算法进行模型的训练;朴素贝叶斯算法基于训练数据学习类别的特征分布,计算每个类别的条件概率,估计每个特征在每个类别中的条件概率;使用已训练好的朴素贝叶斯情感分析模型对待分析的文本进行情感分类,根据预测结果的概率值来理解文本的情感倾向,并将文本的情感倾向性量化为情感分数。
7、在一种实施方式中,所述在云服务器对获取到的数据进行识别,筛选出与情感相关的歌词或音乐元素,包括:
8、获取包含歌词和音乐元素的数据集,包括具有情感标签或主题标签的歌曲、专辑、艺术家信息,含有情感词汇和表达情感的歌词,歌曲中情感相关的元素包括节奏、速度和音调;使用开源资源构建一个情感词库,包括描述情感状态或与情感相关的词语;对获取到的歌词和音乐元素文本进行预处理,包括文本清洗、分词和停用词去除,使用情感词库对文本进行情感词汇的匹配,提取与情感相关的单词或短语作为特征;使用带有情感标签的训练数据集,使用支持向量机训练一个情感分析模型;将特征向量和相应的情感标签输入模型进行训练,获取情感与特征之间的关联;使用已训练好的情感分析模型对获取到的歌词和音乐元素进行情感识别和筛选,将预处理后的文本转换为特征向量,并使用情感分析模型对特征向量进行情感分类,根据模型的预测结果判断文本是否与具体情感相关;根据情感分析的结果,筛选并输出与具体情感相关的歌词或音乐元素。
9、在一种实施方式中,所述形成情感标签-元素对,并将相似或相关的标签进行合并和统一,以降低知识图谱的复杂度,包括:
10、获取联通沃音乐上的歌曲评论,或是使用社交平台获取用户对歌曲的评价,并在公开可用的音乐数据集中获取歌曲元素信息,包括节奏、音调;使用spacy来提取歌曲评论中的情感词汇,并使用情感词典将情感词汇与情感标签进行匹配;同时对歌曲元素进行特征提取,包括提取音调、节奏特征,与情感标签进行匹配;使用余弦相似度计算情感标签的相似度,将相似度高于预设相似度的情感标签进行合并和统一,并对元素进行分类和归一化处理;将匹配和归一化后的情感标签与元素进行组合,构建情感标签与元素对;将每个情感标签与对应的元素组成一个数据行,并存储在表格或数据集中。
11、在一种实施方式中,所述使用数据集成引擎将统一后的标签-元素对整合到一个简化的数据框架里,包括:
12、根据用户需求和数据要求,选择talend数据集成引擎;将统一后的音乐情感标签和音乐元素对应数据存储在不同的数据源中,包括数据库、csv文件、api,提高数据源的可访问性和数据质量;使用talend通过数据库连接或api连接,连接到各个数据源;在引擎的操作界面中,定义数据转换和映射规则,指定关联的字段、数据格式转换和数据清洗,将音乐情感标签和音乐元素对应的数据合并到一个简化的数据框架中;根据定义的规则,运行数据整合流程,talend自动执行数据转换和整合操作,将音乐情感标签和音乐元素对应的数据整合到一个简化的数据框架中;在整合完成后,检查和验证生成的简化数据框架,确保数据的准确性和完整性。
13、在一种实施方式中,所述数据集成完成后,触发知识图谱的更新流程,并将这个简化的数据框架加入到音乐知识图谱中,包括:
14、获取当前的音乐知识图谱结构和更新流程,确定新数据的添加方式以及与已有知识图谱中的实体和关系的对应关系;根据音乐知识图谱的结构要求,从简化的数据框架中提取音乐id、音乐标题、艺术家、情感标签和音乐元素信息,作为新实体或属性的值;使用neo4j,加载已有的音乐知识图谱,进行编辑操作;根据简化数据框架中提取的信息,使用编辑工具添加新的音乐实体到知识图谱中,添加实体时,使用唯一的标识符音乐id,与已有的实体区分开;根据简化数据框架中的信息,为新添加的音乐实体建立与已有实体的关联关系;使用情感标签和音乐元素这两个属性,与其他实体建立关系,与情感实体建立情感关系,与音乐元素实体建立相似或相关关系;在将新实体和关系添加到知识图谱中后,进行验证和校对,确保数据的准确性和完整性,检查新添加的实体和关系是否正确地呈现在知识图谱中;如果验证正常,将最新的知识图谱保存和更新,将新添加的实体和关系与已有的数据进行整合;还包括:通过循环神经网络模型进行实体识别和消歧,确定不同数据框架中的音乐实体是否指代同一实体,获取准确的实体信息;通过图神经网络建立关系模型,从数据框架中抽取音乐实体之间的关系,得到准确的实体关联信息。
15、所述通过循环神经网络模型进行实体识别和消歧,确定不同数据框架中的音乐实体是否指代同一实体,获取准确的实体信息,具体包括:
16、确定需要识别和消歧的实体类型,包括音乐实体中的艺术家、歌曲,确定需要处理的数据框架和数据源。使用已有的音乐数据库、网络爬取的音乐相关文章、评论,获取包含样本实体和对应上下文的数据集作为训练数据,确保训练数据的多样性和代表性。在训练数据中标注实体和上下文,为每个实体分配唯一的标识符。使用实体识别构建实体识别和消歧模型,训练一个循环神经网络模型,识别输入文本中出现的音乐实体,包括艺术家、歌曲名称,输出不同数据框架中的音乐实体是否指代同一实体。使用训练数据对实体识别和消歧模型进行训练,并根据校验数据的效果进行模型调优。使用交叉验证提高模型的准确性和鲁棒性。将训练好的实体识别和消歧模型部署到生产环境中,通过api或其他方式进行模型调用。将待消歧的实体输入模型,获取实体的唯一标识符,获取准确的实体信息。定期监控实体识别和消歧模型的性能并持续进行维护和改进,获取用户反馈和标注,用于迭代模型训练和优化。
17、所述通过图神经网络建立关系模型,从数据框架中抽取音乐实体之间的关系,得到准确的实体关联信息,具体包括:
18、从各种数据源,包括音乐数据库、联通沃音乐、音乐评论获取音乐数据包括歌曲、艺术家、专辑实体以及它们之间的关系。对数据进行清洗和预处理,包括去除噪声、标准化数据。使用tf-idf对歌曲和艺术家的描述进行特征提取,包括风格、流派、情绪,使用音乐指纹,根据音乐本身的音频特性提取特征。根据收集到的数据和提取的特征,选择图神经网络模型来处理音乐实体之间的关系,将音乐实体歌曲、艺术家视为图中的节点,音乐实体之间的关系视为图中的边,训练图神经网络模型来学习节点和边之间的交互。将新的音乐实体和关系输入图神经网络模型,得到音乐实体之间的关联信息,将一首新的歌曲和其艺术家输入模型,图神经网络模型输出音乐实体之间的关联度。使用交叉验证评估模型的准确性和鲁棒性,并根据评估结果对模型进行调整和优化。
19、在一种实施方式中,所述实时检测机制同步更新数据集成框架中新加入的元素或标签,并在超出预定复杂度时自动触发标签的合并和简化,包括:
20、对数据集成框架进行实时监控,获取数据集成框架内新加入的元素和标签;对新加入的元素和标签进行标签合并和简化处理,并将合并和简化后的标签纳入数据集成框架;根据标签数量、标签层级数对判断数据集成框架的复杂度进行评估,如果超出预定复杂度,使用k-means分析框架内的标签,确定哪些标签进一步合并;获取数据集成框架中的标签数据,包括标签的名称、属性、关系,将标签数据转化为相似度矩阵,基于提取的特征,使用余弦相似度计算标签之间的相似度,使用k-means对标签进行聚类分析,根据相似度计算的结果,将相似度高于预设相似度的标签分到同一聚类簇中;对于同一聚类簇的标签,依据聚类簇的特点和标签之间的相似度,制定合并策略;对合并后的标签进行评估,评估其简化程度和对数据集成框架的影响;检测数据集成框架的状态,如果复杂度超出预定复杂度,再次合并和简化数据集成框架;还包括:根据标签数量、标签层级数计算数据集成框架的复杂度。
21、所述根据标签数量、标签层级数计算数据集成框架的复杂度,具体包括:
22、获取音乐相关的数据包括歌曲信息、专辑信息、艺术家信息,将不同数据源的音乐数据整合到一个数据集成框架中。设计标签体系,用于对音乐数据进行分类和标记,根据需求,定义不同层级的标签,包括音乐风格、音乐流派、艺术家类型。统计数据集成框架中的标签数量,包括所有级别的标签,查看数据集成框架中标签的层级结构。对于每个标签,计算其在层级结构中的深度和宽度,标签的深度表示其在层级结构中的层数,标签的宽度表示其具有相同父级的同级标签的数量。获取标签之间的关联关系,包括父子关系、同级关系。对每个指标进行归一化处理并赋予权重,将各个指标的归一化值乘以相应的权重,再将加权值相加得到复杂度评分。
23、在一种实施方式中,所述根据音乐知识图谱,通过决策树算法分析音乐制作人或歌词作者关注的旋律或歌词,包括:
24、获取音乐知识图谱中的信息,包括歌曲的风格、流派和艺术家类型训练一个决策树模型;根据音乐制作人经常制作的音乐类型或风格来分析他们最可能关注的旋律方面,若一个音乐制作人经常制作摇滚音乐,则该音乐制作人更关注吉他的声音和节奏,以及音乐的力度和动态;根据歌词作者创作的歌词的主题和情感来分析关注的歌词方面,若一个歌词作者创作的歌曲大多涉及爱情和伤感,则该歌词作者更关注表达情感和描述情景的词汇和语句;训练决策树模型时,将音乐制作人和歌词作者分别作为两个独立的分类任务;对于每个任务,从音乐知识图谱中提取相应的特征,音乐制作人提取音乐知识图谱中的音乐类型或风格标签,歌词作者提取音乐知识图谱中的主题和情感标签;在训练完成后,使用这个决策树模型来预测音乐制作人和歌词作者在创作新的作品时,关注的旋律或歌词。
25、在一种实施方式中,所述根据决策树算法预测结果,结合音乐知识图谱生成歌词修改方案,以用于修改旋律或歌词,包括:
26、获取决策树模型预测的音乐制作人或歌词作者最可能关注的旋律或歌词;根据预测结果,结合音乐知识图谱中的相关信息,分析需要进行的修改或改进,若决策树预测结果为音乐制作人或歌词作者关注旋律,则根据音乐知识图谱查找与该音乐类型或风格相关的理论或技巧,并获取音乐制作人或歌词作者的音乐库中使用的乐器和音效,以及音乐制作人或歌词作者过去合作的艺术家和音乐风格;对于旋律修改,包括调整音符的选择、改变旋律的结构、增强节奏感;对于歌词修改,包括增加情感表达、改善词汇选择或优化描述技巧;将歌词修改方案发送相关的音乐制作人或歌词作者;获取音乐制作人或歌词作者的反馈,根据实践和反馈结果,进行再次分析和调整;若需要进一步的修改和改进,则继续优化歌词修改方案。
27、本发明实施例提供的技术方案可以包括以下有益效果:
28、本发明公开了一种利用云算力获取音乐平台的非结构化文本,并应用朴素贝叶斯算法进行初步分类的方法。通过筛选出包含歌词或评论的文本,并利用情感分析模块进行情感打分。然后,在云服务器上识别并筛选出与情感相关的歌词或音乐元素。接着,形成情感标签-元素对,并对相似或相关的标签进行合并和统一,以降低知识图谱的复杂度。使用数据集成引擎将统一后的标签-元素对整合到一个简化的数据框架中。完成数据集成后,触发知识图谱的更新流程,并将这个简化的数据框架加入到音乐知识图谱中。同时,通过实时检测机制同步更新数据集成框架中新加入的元素或标签,并在过于复杂时自动触发标签的合并和简化。根据音乐知识图谱,利用决策树算法分析音乐制作人或歌词作者关注的旋律或歌词。最后,根据决策树算法的预测结果生成方案,用于修改旋律或歌词,实现更高效的音乐创作和歌词修改。