ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

NOSA-1B 快速上手教程:10 分钟跑通你的第一次长文本生成

NOSA-1B 快速上手教程:10 分钟跑通你的第一次长文本生成 NOSA-1B 快速上手教程10 分钟跑通你的第一次长文本生成【免费下载链接】NOSA-1B项目地址: https://ai.gitcode.com/OpenBMB/NOSA-1BNOSA-1B 是 OpenBMB 开源社区推出的长文本生成模型采用原生可卸载稀疏注意力机制NOSA让普通显卡也能流畅输出超长内容。这篇 NOSA-1B 快速上手教程将带你用 10 分钟跑通第一次长文本生成无需深厚技术背景照着做就能出结果。NOSA-1B 是什么长文本生成的新选择NOSA-1B 是 OpenBMB 开源社区发布的 10 亿参数长文本生成模型主打超长上下文的文本生成。它首次提出原生可卸载稀疏注意力Native and Offloadable Sparse Attention机制将 KV 缓存智能卸载到内存大幅缓解长文本生成时显存爆掉的痛点。与传统注意力模型相比NOSA-1B 的核心亮点解码吞吐量最高提升 5.04 倍对比 FullAttn 基线仅 1B 参数消费级显卡即可本地部署 配合 LongRoPE 将上下文扩展至32K 以上长文本生成更从容 中英双语支持Apache 2.0 开源协议可商用模型采用稀疏 Llama 架构28 层、2048 隐藏维度训练数据为 InfLLM-V2 长文本数据集专为读得长、写得长而生。NOSA-1B 快速上手的准备工作正式动手前先花 2 分钟确认环境清单如下项目要求Python3.8 及以上PyTorch2.0 及以上建议 GPU 版Transformers4.46 及以上显卡1B 模型仅需数 GB 显存多数消费级显卡可跑一条命令安装全部依赖pip install torch transformers accelerate第一步用最快方法获取 NOSA-1B 模型克隆仓库即可一次性拿到模型权重 分词器 推理代码git clone https://gitcode.com/OpenBMB/NOSA-1B仓库内已包含pytorch_model.bin权重文件稀疏注意力核心实现位于modeling_llama_long_infllmv2.py与cis_pooling.py模型参数配置见config.json与generation_config.json无需再单独下载任何文件。第二步3 分钟加载模型在项目目录下新建脚本用 Transformers 加载模型与分词器from transformers import AutoModelForCausalLM, AutoTokenizer model_dir ./NOSA-1B # 克隆下来的模型目录 tokenizer AutoTokenizer.from_pretrained(model_dir, trust_remote_codeTrue) model AutoModelForCausalLM.from_pretrained( model_dir, torch_dtypeauto, trust_remote_codeTrue, device_mapauto, )提示模型使用自定义稀疏注意力代码务必加上trust_remote_codeTrue否则无法加载。第三步跑通你的第一次长文本生成输入一段提示词让 NOSA-1B 生成一篇长文prompt 请以《秋天的傍晚》为题写一篇 800 字左右的散文。 inputs tokenizer(prompt, return_tensorspt).to(model.device) outputs model.generate( **inputs, max_new_tokens2000, # 生成长度 do_sampleTrue, temperature0.8, # 随机性 top_p0.8, # 核采样 ) print(tokenizer.decode(outputs[0], skip_special_tokensTrue))等待片刻一篇完整的散文就生成好了。把max_new_tokens调大如 4000即可一次性输出更长文本这正是 NOSA-1B 长文本生成的核心场景。提升长文本生成质量的实用技巧调节采样参数温度越低越严谨如 0.5越高越有创意如 0.9top_p配合温度一起调效果更稳。善用对话模板模型内置 MiniCPM 风格 Chat 模板多轮对话场景可调用apply_chat_template构造输入。长文分段生成先让模型写大纲再逐段扩写内容结构更完整避免长文跑偏。显存不够时启用 KV 缓存卸载特性并搭配device_mapauto自动分配普通笔记本也能坚持更长的生成长度。一张表看懂 NOSA-1B 性能优势对比基线解码吞吐量提升FullAttn全注意力最高 5.04×InfLLMv2最高 1.92×ShadowKV最高 1.83×更高的解码吞吐意味着同样的时间里能生成更多文字长文本生成体验更流畅。长文本生成常见问题解答Q1没有高端显卡能跑吗能。1B 模型体量小配合 KV 缓存卸载机制显存占用显著低于同规格模型消费级显卡即可运行。Q2生成到一半内容开始重复怎么办适当降低temperature如 0.7或引入repetition_penalty都能有效减少重复。Q3想生成中文长文需要额外配置吗不需要。模型原生支持中英双语直接输入中文提示词即可。Q4代码报错加载不了模型请确认 Transformers 版本 ≥ 4.46并已添加trust_remote_codeTrue。结语从克隆仓库到生成第一篇长文本全程只需 10 分钟。NOSA-1B 用稀疏注意力把长文本生成的门槛拉到了消费级硬件水平无论你是想写小说、做摘要还是处理超长文档都值得一试。现在就打开终端跑通属于你的第一次长文本生成吧【免费下载链接】NOSA-1B项目地址: https://ai.gitcode.com/OpenBMB/NOSA-1B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表