AgentBench

全面评估大型语言模型在多环境下的自主代理能力

AgentBench LLM-as-Agent 评估框架测试结果任务设置 Github 开源项目

AgentBench是首个评估大型语言模型（LLM）作为自主代理的基准，涵盖操作系统、数据库、知识图谱等8个不同环境。该项目通过多任务设置和完整的数据集，深入分析LLM的实际应用能力。新版AgentBench v0.2优化了框架结构，并增加了更多模型的测试结果，方便开发者扩展和使用。

MobileAgent - 移动设备多模态操作助手

CCL 2024GithubICLR 2024Mobile-Agent多代理协作开源项目移动设备操作助手

移动设备操作助手家族，包括Mobile-Agent-v3和Mobile-Agent-v2，支持多模态操作和高效导航。该项目通过多代理协作实现快速推理和低内存消耗，适用于各类应用场景。Mobile-Agent在CCL 2024上荣获最佳演示奖，并提供在Hugging Face和ModelScope上的在线体验，无需额外配置即可使用，满足智能操作需求。

bigcodebench - 高难度代码生成基准测试评估LLM编程能力

BigCodeBenchGithub代码生成大语言模型开源项目编程能力评估基准

BigCodeBench是一个具有挑战性的代码生成基准测试，用于评估大型语言模型的实际编程能力。它提供复杂指令和多样函数调用，包括数据集、生成和评估脚本。基于EvalPlus框架，BigCodeBench实现精确评估和排名，提供预生成样本以加速研究。支持多种评估环境，采用unittest进行代码测试，为研究人员提供全面工具。

SWE-agent - 将 LM（例如 GPT-4）转换为软件工程代理问题来解决的工具

GitHubGithubLM-centricPrinceton UniversitySWE-agent开源项目软件工程

SWE-agent由普林斯顿大学团队开发，将语言模型（如GPT-4）转变为能在实际GitHub仓库中解决问题的软件工程代理。通过设计简洁的指令和反馈格式，SWE-agent能够浏览仓库、查看、编辑和执行代码文件。在SWE-bench测试中，SWE-agent实现了12.47%的问题解决率，达到了最先进的性能。用户可以通过网页界面或命令行使用SWE-agent，详细信息请查阅项目文档。

generativeAgent_LLM - 交互式人类行为模拟框架

AI模拟Generative AgentsGithubLangchain人工智能开源项目本地LLM

generativeAgent_LLM是一个基于Guidance、Langchain和本地LLM的生成式智能体框架。该项目支持记忆检索、反思、规划和对话生成等功能，能够模拟人类行为并实现交互。它在Langchain基础上进行了改进和扩展，添加了更多特性，更贴近原始论文的设计。除了支持本地LLM，项目还提供代理总结和采访等功能。同时包含详细使用说明和示例代码，便于快速上手和定制开发。

agentcloud - 私有LLM聊天应用的开源构建与部署平台

AgentCloudGithubLLM聊天应用Python应用开源平台开源项目数据交互

AgentCloud是一个开源平台，帮助公司构建和部署私有LLM聊天应用，确保团队可以安全地与数据互动。平台包括Python开发的Agent Backend、Next.js构建的Webapp和Rust实现的Vector Proxy，支持集成Qdrant向量数据库和Google Cloud服务。平台提供详细教程和文档，方便用户快速上手。AgentCloud有一个活跃的社区和公开路线图，欢迎用户贡献和反馈。

llmperf-leaderboard - LLM推理服务性能基准测试与比较

GithubLLMPerfLLM推理提供商吞吐量响应时间开源项目性能基准测试

LLMPerf Leaderboard 项目对多家LLM推理服务进行性能评测，主要衡量输出令牌吞吐量和首个令牌响应时间(TTFT)。测试涵盖Llama-2系列的7B、13B和70B聊天模型，为开发者提供客观透明的性能数据和可复现的测试方法，有助于选择合适的LLM服务。

awesome-llm-agents - LLM代理资源一览，涵盖框架、应用与平台

Awesome LLM agentsGithubHaystackLangchainLlama IndexVisualGPT开源项目

本列表收录了优秀的LLM代理资源，涵盖开源框架、实用应用、平台及重要论文和讲座。关键工具包括Langchain、Llama Index、Haystack等，旨在为开发者提供高效的NLP解决方案。用户还可以提交和建议更多资源，支持社区开发。

OpenAgents - 语言代理开放平台

Data AgentGithubOpenAgentsPlugins AgentWeb Agent开源项目语言智能代理

OpenAgents是一个开放型语言代理平台，通过聊天界面提供数据分析、插件整合及网页浏览功能。其支持快速易部署的代码结构和用户友好的Web界面，配备丰富的定制选项，适合技术开发者和普通用户。平台现有三种代理，分别优化数据操作、提供多样插件和自动化网页导航，适用于多场景应用。

BotChat - 创新评估大语言模型多轮对话能力的基准

BotChat BenchmarkGPT-4GithubLLM对话生成开源项目评估

BotChat基准测试通过分析大语言模型生成的对话评估多轮聊天能力。基于MuTual-Test数据集,该项目生成了大规模模型对话数据,并采用单轮评估、BotChat Arena和人类对话对比等方法全面评估主流LLM对话质量。研究发现GPT-4表现最佳,部分小型开源模型在短对话中也有不错表现。这一创新基准为改进LLM对话能力提供了新思路。

ScreenAgent - 由视觉语言大模型驱动的电脑控制工具

GithubIJCAI 2024ScreenAgentVLM Agent开源项目数据集自动控制

ScreenAgent项目创建了一个由视觉语言模型驱动的电脑控制环境，允许代理通过截图与真实屏幕互动并操作GUI。自动控制流程分为规划、执行和反思三个阶段，使代理能够完成多步骤任务。项目包含丰富的截图和操作序列数据集，支持包括GPT-4V、LLaVA-1.5、CogAgent和ScreenAgent在内的多种模型，并提供简化体验的网页版客户端。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com