SimpleHTR

TensorFlow手写文本识别系统，支持单词和整行文本识别

TensorFlow 手写文字识别 IAM数据集 CTC解码字束搜索解码 Github 开源项目

本手写文本识别系统使用TensorFlow实现，并训练于IAM数据集。其能够识别单词和整行文本，验证集中3/4的单词被正确识别，字符错误率约为10%。系统提供预训练模型下载和多种解码器选项，包括适用于Windows的word beam search解码器。此外，还支持快速数据加载和训练设置，适合快速开发与部署文本识别应用。

Github

介绍相关项目

Whisper-Finetune - 语音识别模型的高效微调与加速

GithubWhisper中文识别加速推理开源项目模型微调语音识别

Whisper-Finetune项目致力于优化OpenAI的Whisper语音识别模型。该项目采用Lora技术进行微调，支持多种数据类型的训练，并通过CTranslate2和GGML实现加速推理。此外，项目提供了跨平台应用和服务器部署方案，为语音识别应用开发提供了全面支持。

io - 由 TensorFlow SIG-IO 维护的数据集、流式处理和文件系统扩展

GithubKerasMNISTTensorFlow I/O开源项目文件格式文件系统

TensorFlow I/O 扩展了 TensorFlow 的数据处理功能，支持多种文件系统和格式，简化数据集访问。通过 tensorflow-io，可直接使用 HTTP/HTTPS 读取和处理数据，无需下载或存储。此外，该项目支持 Docker 镜像和 R 包，兼容最新的 TensorFlow 版本，并集成多种系统和云服务。详细信息和使用示例请参考官方文档。

Tokenizer - 跨平台BPE编码实现

C#GithubOpenAITokenizationTokenizerTypescript开源项目

该项目提供了TypeScript和C#版的字节对编码(BPE)tokenizer，主要用于OpenAI LLMs，并基于开源的Rust实现。适用于Node.js和.NET环境，在传递提示词给LLM前进行tokenization处理。建议C#用户从Microsoft.DeepDev.TokenizerLib迁移至性能更优的Microsoft.ML.Tokenizers。欢迎开发者贡献代码和意见。

MobileCLIP-S2-OpenCLIP - 高效图像-文本模型通过多模态强化训练实现性能突破

GithubHuggingfaceMobileCLIPOpenCLIP图像文本模型多模态强化训练开源项目模型零样本图像分类

MobileCLIP-S2-OpenCLIP是一款基于多模态强化训练的高效图像-文本模型。相比SigLIP的ViT-B/16模型，它在性能上有所超越，同时速度提升2.3倍，模型体积缩小2.1倍，且仅使用了1/3的训练样本。在ImageNet零样本分类任务中，该模型达到74.4%的Top-1准确率，在38个数据集上的平均性能为63.7%，体现了出色的效率与性能平衡。

tracr - 开源编译器实现RASP程序到Transformer权重的转换

GithubRASPTracrtransformer开源项目编译器解释性

tracr是一个开源编译工具，可将RASP程序转换为Transformer权重。它通过追踪程序、推断基向量和中间表示，最终生成Haiku模型。tracr支持类别和数值表示，使用BOS标记实现多种操作，并探索了残差流压缩嵌入。研究人员可以利用tracr编译RASP程序，查看中间激活值，深入分析模型行为，为Transformer可解释性研究提供实验平台。

Umi-OCR_v2 - 开源多语言OCR软件支持批量处理和自定义识别

GithubUmi-OCR仓库迁移开源项目版本更新项目重构

Umi-OCR是一款开源的光学字符识别软件，支持多语言识别、批量处理和自定义识别区域。项目已完成v2版本重构并发布2.0.0正式版，迁移至主仓库继续更新。Umi-OCR作为长期项目，将持续优化识别精度和用户体验。

End-to-end-for-chinese-plate-recognition - 中文车牌识别与矫正的解决方案

CNNEnd-to-end-for-chinese-plate-recognitionGithubTensorFlowU-Net开源项目车牌识别

项目基于u-net、cv2和卷积神经网络(cnn)，使用tensorflow和keras实现。功能包括中文车牌的定位、矫正和识别。通过u-net进行图像分割，cv2进行边缘检测和车牌区域矫正，再用cnn实现多标签端到端识别。测试表明，系统在拍摄角度倾斜、强曝光和昏暗环境下表现出色，甚至对某些百度AI未能识别的车牌也能识别。请确保输入图片尺寸小于240x80，以获得最佳识别效果。详情请参阅CSDN博客。

SenseVoice - 高效、多语种语音识别与情绪识别技术平台

GithubSenseVoice多语言语音识别开源项目情绪识别推理效率热门音频事件检测

SenseVoice是一款支持多语言的语音解析模型，整合了自动语音识别、语种识别、情绪识别及音频事件检测功能。该项目采用非自回归端到端框架，可在超过50种语言上提供精准的语音识别服务，大幅降低了推理延迟，提供方便的微调脚本和多语种细粒度情绪分析，支持多种客户端语言和服务部署，适用于多种商业场景。

facenet - 基于TensorFlow的高精度面部识别开源项目

FaceNetGithubInception ResNet v1TensorFlow人脸识别开源项目预训练模型

FaceNet，一个基于TensorFlow的开源面部识别项目，采用最新的深度学习技术和数据集（如CASIA-WebFace和VGGFace2）开发。其准确率可达99.65%，并使用MTCNN进行高效的面部对齐。适合需求高级面部识别技术的开发者和科研人员。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号