BU-30B-A3B-Preview模型深度解析:300亿参数背后的视觉-语言混合专家架构 BU-30B-A3B-Preview模型深度解析300亿参数背后的视觉-语言混合专家架构【免费下载链接】bu-30b-a3b-preview项目地址: https://ai.gitcode.com/hf_mirrors/browser-use/bu-30b-a3b-previewBU-30B-A3B-Preview是一款突破性的视觉-语言混合专家模型基于Qwen3-VL-30B-A3B-Instruct架构构建拥有300亿总参数和30亿活跃参数的混合专家MoE设计。这款模型专为浏览器使用场景优化能在单GPU上高效运行同时提供卓越的DOM理解和视觉推理能力。模型核心架构解析混合专家MoE设计效率与性能的完美平衡BU-30B-A3B-Preview采用了创新的混合专家架构这是其能在保持高性能的同时大幅降低计算资源需求的关键。模型包含128个专家num_experts: 128但每个token仅由其中8个专家处理num_experts_per_tok: 8。这种设计使模型在拥有300亿总参数的同时实际活跃参数仅为30亿大幅降低了推理时的计算负载。视觉-语言双模态融合模型的视觉和语言处理模块通过精心设计的接口实现无缝协作视觉编码器采用27层深度网络depth: 27输入图像通过16x16的补丁大小patch_size: 16转换为1152维特征hidden_size: 1152最终投影到2048维与语言模型对齐out_hidden_size: 2048语言模型包含48层Transformernum_hidden_layers: 4832个注意力头num_attention_heads: 32隐藏层维度2048hidden_size: 2048支持长达32768 tokens的上下文max_model_len: 32768特殊标记系统通过|vision_start|151652和|vision_end|151653等特殊标记实现视觉内容与文本的精准对齐同时支持视频输入|video_pad|151656和对象引用|object_ref_start|/|object_ref_end|等高级功能快速上手指南通过BU Cloud使用推荐新手从BU Cloud获取API密钥设置环境变量export BROWSER_USE_API_KEYyour-key安装browser-use库并运行from dotenv import load_dotenv from browser_use import Agent, ChatBrowserUse load_dotenv() llm ChatBrowserUse( modelbrowser-use/bu-30b-a3b-preview, # BU开源模型 ) agent Agent( task比较browser-use和stagehand的星标数量并告诉我哪个更多, llmllm, flash_modeTrue ) agent.run_sync()本地部署vLLM方式对于有一定技术背景的用户推荐使用vLLM进行本地部署安装vLLM确保版本≥0.12.0pip install vllm --upgrade启动服务vllm serve browser-use/bu-30b-a3b-preview \ --max-model-len 32768 \ --host 0.0.0.0 \ --port 8000通过OpenAI兼容接口使用from browser_use import Agent, ChatOpenAI llm ChatOpenAI( base_urlhttp://localhost:8000/v1, modelbrowser-use/bu-30b-a3b-preview, temperature0.6, top_p0.95, dont_force_structured_outputTrue, # 禁用结构化输出以提高速度 ) agent Agent( task比较browser-use和stagehand的星标数量并告诉我哪个更多, llmllm, ) agent.run_sync()模型技术规格详解属性数值基础模型Qwen/Qwen3-VL-30B-A3B-Instruct总参数300亿活跃参数30亿MoE架构上下文长度32,768 tokens架构类型视觉-语言混合专家模型视觉输入图像、视频** dtype**bfloat16分词器词汇量151,936浏览器使用场景优势BU-30B-A3B-Preview针对浏览器使用场景进行了深度优化主要优势包括卓越的DOM理解能力模型能精准解析网页结构理解HTML元素之间的关系和布局这得益于其特殊设计的对象引用标记|object_ref_start|/|object_ref_end|和框选标记|box_start|/|box_end|。强大的视觉推理能力通过视觉编码器的深度栈27层和空间合并技术spatial_merge_size: 2模型能处理复杂的视觉场景识别网页中的图像内容并将其与文本信息关联。高效的工具调用能力模型内置工具调用机制tool_call//tool_call和tool_response//tool_response能无缝集成浏览器操作实现自动化网页交互。总结BU-30B-A3B-Preview代表了浏览器AI助手的新一代技术方向通过混合专家架构在性能和效率之间取得了完美平衡。300亿参数的模型能在单GPU上流畅运行同时提供SoTA级别的DOM理解和视觉推理能力为浏览器自动化和智能助手应用开辟了新的可能性。无论是通过BU Cloud快速体验还是使用vLLM进行本地部署这款模型都能为开发者和普通用户提供强大而灵活的浏览器AI能力。随着浏览器使用场景的不断扩展BU-30B-A3B-Preview无疑将成为构建下一代智能网页应用的关键基础设施。【免费下载链接】bu-30b-a3b-preview项目地址: https://ai.gitcode.com/hf_mirrors/browser-use/bu-30b-a3b-preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

本月热点