2025年04月25日
开源项目 · 最新文章
大模型的新突破:LiveCC 让“直播 AI 解说”成为现实
LiveCC 是一个开源项目,旨在让视频大语言模型(Video LLM)实时处理直播视频流并融合语音转录,轻松实现画面与语音的多模态理解。
Easy Diffusion 是一个免费开源的图像生成工具,把复杂的Stable Diffusion模型包装成了一个“傻瓜式”的创作平台。
2025年04月24日
Upscayl 是一个免费开源的AI图像放大工具,利用先进的人工智能算法(主要是Real-ESRGAN),将低分辨率图像放大到更高分辨率,同时保留细节、增强质量。它就像一个“图像魔法师”,能让你的照片从“像素马赛克”变成“高清大片”。
2025年04月24日
Activepieces 是一个开源的业务自动化平台,目标是让技术小白和开发者都能轻松构建工作流程自动化。它有点像Zapier或IFTTT,但更开放、更灵活,支持自托管,数据完全掌握在你手里。
2025年04月24日
MAGI-1 是一个基于AI的视频生成模型,专注于通过文本指令生成高质量视频。它的核心理念是将视频分成一个个小块(chunk),通过自回归的方式逐块生成,最终拼成一段流畅的视频。这种“分块生成”的方式不仅高效,还能保证视频的时间连贯性和细节表现。
2025年04月24日
llms-txt 提出了一个标准化的文件格式——/llms.txt,这是一个 Markdown 文件,放置在网站的根目录下,专门为 LLM 提供简洁、结构化的信息。
2025年04月24日
Suna 是一个开源通用 AI 代理平台,通过自然语言对话,帮助用户完成各种现实世界的任务。简单来说,你可以用类似聊天的形式,告诉 Suna 你想做什么,它就能帮你搞定,从数据分析到网页自动化,甚至是网站部署,功能覆盖面非常广。
2025年04月23日
so-vits-svc是一个基于 VITS(Variational Inference with adversarial learning for end-to-end Text-to-Speech)的歌声转换(Singing Voice Conversion, SVC)项目,专注于将一段歌声的音色转换为另一个音色,同时保留原始的音调和情感。
2025年04月22日
HumanRig 是一个专注于 3D 人形角色自动绑定的数据集和框架,简单来说,它能帮你把复杂的 3D 模型快速“动起来”,省去手动绑定的繁琐过程。
2025年04月20日
GigaTok是一款拥有 30 亿参数的视觉标记器,致力于将视觉分词器扩展至 30 亿参数,用于自回归(AR)图像生成。
2025年04月20日
你可能还喜欢









