AI开发工具
AI开发框架、模型部署、API工具、本地推理、基准测试平台
AI开发工具介绍
AI开发框架、模型部署、API工具、本地推理、基准测试平台。本分类已收录 47 款精选工具,涵盖 代码生成、模型部署、模型训练、模型评测 等细分领域。
这些工具适用于 代码生成、代码补全、编程辅助、代码审查 等场景,帮助你高效完成工作与创作。
分类中包含免费及免费增值工具,方便你零成本体验。
AI开发工具 教程
全部教程DeepSeek官网:免费体验V4系列AI模型
DeepSeek 官方对话平台提供最新 V4 系列模型,包括 V4 Pro(专家模式)和 V4 Flash(即时响应模式),用户无需付费即可注册使用。平台支持无限次对话,并持续集成新功能,满足从专业研究到日常问答的多样化需求。作为国产开源大模型的代表,DeepSeek 在推理能力、代码生成和多语言理解上表现突出,是个人开发者与企业的理想选择。
小米MiMo Studio:新一代AI对话模型体验平台
MiMo Studio是小米推出的AI对话模型体验平台,提供MiMo-V2.5-Pro和MiMo-V2.5两款先进模型。用户可通过官网注册并免费试用,体验小米在自然语言处理领域的最新成果。平台旨在为开发者和普通用户提供便捷的AI交互入口,支持多种应用场景,如内容创作、代码辅助、知识问答等。MiMo-V2.5系列模型在理解能力、生成质量和响应速度上均有显著提升,是小米AI技术的重要展示窗口。
Google AI Studio:体验最新Gemini模型
Google AI Studio 是谷歌推出的在线AI开发平台,提供最新的Gemini系列模型,包括Gemini 3.1 Pro Preview、Gemini 3.5 Flash-Lite和3.6 Flash等。用户无需复杂配置,通过Google账号即可快速体验和测试这些前沿模型。平台支持添加自定义功能,适合开发者进行原型设计、实验和集成。无论是快速生成文本、分析数据,还是构建AI应用,Google AI Studio都提供了便捷的入口,是AI爱好者和开发者的理想选择。
AI开发工具 工具
共 47 个工具第 1 页 · 每页 24 条 · 共 47 个工具
KoboldCpp
KoboldCpp 是基于 llama.cpp 的本地大语言模型运行工具,同时提供 API 接口和图形界面,并支持 AMD ROCm 加速以及 Google Colab 云端部署。核心功能包括在本地加载多种开源模型进行文本生成、对话交互,并可通过 API 集成到其他应用。适合开发者、AI 爱好者在离线环境或自定义配置下运行大模型,也适合需要在 Colab 上快速体验大语言模型的用户。
Hugging Face
Hugging Face 是机器学习和人工智能领域的协作平台,提供模型库、数据集和论文资源。核心功能包括访问与分享预训练模型、部署推理 API、阅读最新AI论文,并支持社区协作。适合开发者、研究人员和AI爱好者进行模型实验、微调及部署。
Unsloth
Unsloth 是一个面向大语言模型微调(LLM Finetuning)的实用工具,支持文本补全任务,并提供可交互的 Notebook 与详细指南。它适合开发者、研究人员在本地或云端环境中快速完成模型参数调整,降低微调门槛和资源消耗,适用于定制化文本生成、领域模型训练等场景。
FutureTools
FutureTools 是一个 AI 工具导航目录,收录了数百款主流及新兴 AI 应用。它按功能分类展示,提供筛选、搜索和评测,帮助用户快速找到适合的图像、文本、视频、编程等各类 AI 工具。适合开发者、产品经理或对 AI 感兴趣的用户日常探索与选型。
SWEBench
SWEBench 是专注于软件工程领域的 AI 基准评测平台,提供标准化的排行榜与评估基准。其核心功能是衡量 AI 模型在代码生成、调试、修复等真实开发任务上的表现,帮助对比不同模型的技术能力。适合 AI 研究者、开发者以及企业技术团队,用于验证代码智能工具在复杂工程场景中的实际效果。
Kaggle Benchmarks
Kaggle Benchmarks 是一个专注于聊天机器人性能评测的排行榜与基准测试平台。它提供标准化的评测指标和公开数据集,帮助开发者与研究人员客观对比不同对话模型的推理能力、知识准确性以及回复质量。适合AI团队进行模型选型评估、学术研究者验证算法效果,以及企业寻找适合自身业务场景的对话引擎时参考。
Open VLM Leaderboard
Open VLM Leaderboard 是一个视觉语言模型(VLM)的基准测评排行榜聚合平台。它汇总了主流 VLM 在多种公开测试集上的表现,提供统一排名与性能对比,帮助研究者、算法工程师和模型选型者快速了解不同模型在视觉理解、指令跟随等任务上的能力差异,适合模型评测、技术选型与学术调研场景。
llama.cpp
llama.cpp 是一个用于在本地运行大型语言模型的开源推理工具,基于 C/C++ 实现,支持多种 Transformer 架构模型的量化与高效推理。它让你完全自主部署 LLM,无需联网或依赖云服务。适合需要数据隐私保护、离线使用或进行模型试验的开发者与研究者。
Stable Diffusion
Stable Diffusion 是一个开源的 AI 图像生成模型,支持在本地部署运行,用户可自由进行模型微调与自定义训练。核心功能包括根据文本描述生成高质量图像、图像修复、扩展合成以及风格迁移。适合需要深度控制生成过程、注重数据隐私的个人创作者、设计师和研究者,尤其适用于离线环境下的创意实践与实验。
LLM Model VRAM Calculator
LLM Model VRAM Calculator 专为 AI 开发者设计,用于估算大语言模型运行所需的显存(VRAM)和内存资源。用户输入模型参数规模、精度格式等配置,即可快速计算单卡或多卡部署下的资源需求,辅助选择硬件方案。适合模型部署、推理优化、预算规划场景。

DesignArena
DesignArena 是一个专注于AI设计领域的基准测试平台,通过标准化的评测任务对各类AI设计工具进行能力评估和排名。核心功能包括客观的性能对比、排行榜展示以及多维度分析,帮助用户快速了解不同工具在图像生成、编辑、风格迁移等任务上的优劣。适合设计师、AI开发者和企业选型时参考,以便根据实际需求选择最匹配的AI设计工具。
Hyperspace
Hyperspace 是一个基于点对点(P2P)架构的去中心化 AI 网络,允许用户共享或租用计算资源来运行和部署 AI 模型。其核心功能包括分布式推理、模型托管以及社区驱动的算力市场,可降低 AI 应用的门槛和成本。适合对去中心化计算感兴趣的技术爱好者、AI 开发者以及希望利用闲置设备运行模型的研究人员。
Epoch AI
Epoch AI 汇集多项主流 AI 基准测试,为模型性能提供综合评估与对比分析。用户可一站式查看不同维度的测评结果,帮助研究人员和开发者快速把握模型能力趋势,适合需要全面了解 AI 模型表现的技术团队与行业观察者。

Design Arena
Design Arena 是一个集成多种模型的 AI 视频编辑工具,支持视频剪辑、模型随机组合与参数重置,同时提供临时邮箱功能便于快速试用。适合需要快速尝试不同 AI 视频效果、进行创意剪辑的用户,无需注册即可体验多样化的视频处理。
LLMs Bullshit Benchmark
LLMs Bullshit Benchmark 是一个专门用于评估大语言模型在检测错误前提能力的基准测试。它通过设定一系列含有逻辑矛盾或虚假前提的问题,考验模型能否识别并拒绝回答。适合 AI 研发者、评测人员检验模型的逻辑推理与事实判断水平,在进行模型选型或优化时提供参考依据。
Can I Run AI Locally
Can I Run AI Locally 是一个帮助用户快速判断本地设备能运行哪些 AI 模型的在线工具。它通过分析你的硬件配置(如 GPU、内存等),列出兼容的模型和推荐设置,节省手动查阅兼容性的时间。适合想在自己电脑上部署开源大语言模型或图像生成模型的开发者、技术爱好者与本地 AI 玩家。
WhichLLM
WhichLLM 是一个专注于大语言模型性能对比的开源工具。它支持对不同 LLM 在推理速度、准确率、资源占用等关键指标上进行基准测试与结果可视化,帮助开发者快速评估模型差异。适用于 AI 应用开发中的模型选型、技术调研和性能调优场景,尤其适合需要对比多个开源或闭源模型性能的开发者与研究人员。
EQ-Bench
EQ-Bench 是一个专门用于评估 AI 情感智能水平的基准测试工具。它提供标准化的测试题目,衡量大语言模型在情绪识别、共情理解与情感推理等方面的表现。适合 AI 研究人员和模型开发者用于对比不同模型的情感认知能力,也可以帮助筛选更适合情感交互场景的语言模型。
Jailbreak Listings
Jailbreak Listings 是一个汇总各类 AI 模型越狱提示词与红队测试资源列表的在线目录。它主要收集可用于绕过 AI 内容限制的指令、角色扮演模板和对抗性提示,并持续更新来源。适合 AI 安全研究员、红队测试人员以及关注模型边界分析的技术用户,作为参考和学习样本集合。
Vals AI
Vals AI 专注于为金融、税务和法律领域提供 AI 模型性能基准评测。它通过系统化的测试数据集和评估指标,帮助企业和开发者客观衡量 AI 在专业场景下的准确性与合规表现。适合需要验证 AI 财务分析、税务申报或法律文书处理效果的机构团队,用于模型选型、迭代优化和监管合规自检。

ChessArena
ChessArena 是一个专注国际象棋 AI 的评测基准平台,提供标准化的棋力测试环境。核心功能包括多模型对战、评分排行和复盘分析,帮助开发者对比不同 AI 下棋引擎的性能差异。适合人工智能研究人员、国际象棋算法工程师以及棋类爱好者评估和优化模型表现。
VoxelBench
VoxelBench 是一个专注于Minecraft领域的AI生成能力评测基准平台,提供标准化的评价体系和测试数据集。其主要功能包括评估模型在体素风格内容生成上的表现,涵盖结构合理性、风格一致性等多维度指标。适合游戏开发者、AI研究员及Minecraft社区创作者,用于比较和优化生成模型的性能。
LLM Stats
LLM Stats 是一个展示主流聊天机器人性能排名的评测平台,通过汇聚多个模型在各类基准测试中的表现数据,帮助用户直观对比不同语言模型的能力差异。适合开发者、AI 研究人员以及需要选型决策的企业,快速了解当前模型的综合实力与热门趋势。
ModelScope Finetuning
ModelScope Finetuning 是一个面向图像生成模型的微调工具,支持用户基于文本到图像模型训练自定义 LoRA。核心功能包括上传最多 100 张图片进行风格或主题训练,并快速生成个性化图像。适合需要定制专属绘画模型的设计师、创作者或 AI 绘画爱好者使用。