mirror of
https://github.com/orange-cpp/omath.git
synced 2026-08-08 14:02:06 +00:00
Compare commits
8 Commits
v5.5.0
...
b3c8438bf1
| Author | SHA1 | Date | |
|---|---|---|---|
| b3c8438bf1 | |||
| 335096d0c8 | |||
| 9f4cc99790 | |||
| f2ff761823 | |||
| 4cd5e8f829 | |||
| eac3adba2a | |||
| 4e413d977a | |||
| d4c86dacc7 |
@@ -245,72 +245,37 @@ jobs:
|
|||||||
run: |
|
run: |
|
||||||
./out/Debug/unit_tests.exe
|
./out/Debug/unit_tests.exe
|
||||||
|
|
||||||
- name: Process Coverage (llvm-profdata & llvm-cov)
|
- name: Process and render coverage
|
||||||
if: ${{ matrix.triplet == 'x64-windows' }}
|
if: ${{ matrix.triplet == 'x64-windows' }}
|
||||||
shell: pwsh
|
shell: pwsh
|
||||||
run: |
|
run: |
|
||||||
$BUILD_DIR = "cmake-build/build/${{ matrix.preset }}"
|
$buildDir = "cmake-build/build/${{ matrix.preset }}"
|
||||||
$EXE_PATH = "./out/Debug/unit_tests.exe"
|
$exePath = "./out/Debug/unit_tests.exe"
|
||||||
|
$profile = "$buildDir/unit_tests.profdata"
|
||||||
|
$htmlDir = "$buildDir/coverage-html"
|
||||||
|
|
||||||
# 1. Merge raw profile data (essential step)
|
|
||||||
& "C:/Program Files/LLVM/bin/llvm-profdata.exe" merge `
|
& "C:/Program Files/LLVM/bin/llvm-profdata.exe" merge `
|
||||||
-sparse "$BUILD_DIR/unit_tests.profraw" `
|
-sparse "$buildDir/unit_tests.profraw" `
|
||||||
-o "$BUILD_DIR/unit_tests.profdata"
|
-o $profile
|
||||||
|
|
||||||
# 2. Export to LCOV format
|
if ($LASTEXITCODE -ne 0) {
|
||||||
# NOTE: We explicitly ignore vcpkg_installed and system headers
|
exit $LASTEXITCODE
|
||||||
& "C:/Program Files/LLVM/bin/llvm-cov.exe" export "$EXE_PATH" `
|
|
||||||
-instr-profile="$BUILD_DIR/unit_tests.profdata" `
|
|
||||||
-format=lcov `
|
|
||||||
-ignore-filename-regex="vcpkg_installed|external|tests" `
|
|
||||||
> "$BUILD_DIR/lcov.info"
|
|
||||||
|
|
||||||
if (Test-Path "$BUILD_DIR/lcov.info") {
|
|
||||||
Write-Host "✅ LCOV info created at $BUILD_DIR/lcov.info"
|
|
||||||
} else {
|
|
||||||
Write-Error "Failed to create LCOV info"
|
|
||||||
exit 1
|
|
||||||
}
|
}
|
||||||
|
|
||||||
- name: Install LCOV (for genhtml)
|
& "C:/Program Files/LLVM/bin/llvm-cov.exe" show $exePath `
|
||||||
if: ${{ matrix.triplet == 'x64-windows' }}
|
"-instr-profile=$profile" `
|
||||||
run: choco install lcov -y
|
"-format=html" `
|
||||||
|
"-output-dir=$htmlDir" `
|
||||||
|
"-ignore-filename-regex=vcpkg_installed|external|tests" `
|
||||||
|
"-show-branches=count"
|
||||||
|
|
||||||
- name: Generate HTML Report
|
if ($LASTEXITCODE -ne 0) {
|
||||||
if: ${{ matrix.triplet == 'x64-windows' }}
|
exit $LASTEXITCODE
|
||||||
shell: bash
|
}
|
||||||
run: |
|
|
||||||
BUILD_DIR="cmake-build/build/${{ matrix.preset }}"
|
|
||||||
LCOV_INFO="${BUILD_DIR}/lcov.info"
|
|
||||||
HTML_DIR="${BUILD_DIR}/coverage-html"
|
|
||||||
|
|
||||||
# Fix paths for genhtml (Perl hates backslashes)
|
if (-not (Test-Path "$htmlDir/index.html")) {
|
||||||
sed -i 's|\\|/|g' "${LCOV_INFO}"
|
throw "LLVM coverage report was not generated"
|
||||||
|
}
|
||||||
# Locate genhtml provided by 'choco install lcov'
|
|
||||||
# It is typically in ProgramData/chocolatey/lib/lcov/tools/bin
|
|
||||||
GENHTML=$(find /c/ProgramData/chocolatey -name genhtml -print -quit)
|
|
||||||
|
|
||||||
if [ -z "$GENHTML" ]; then
|
|
||||||
echo "Error: genhtml executable not found"
|
|
||||||
exit 1
|
|
||||||
fi
|
|
||||||
|
|
||||||
echo "Using genhtml: $GENHTML"
|
|
||||||
mkdir -p "$HTML_DIR"
|
|
||||||
|
|
||||||
# Run genhtml
|
|
||||||
# Added --demangle-cpp if your version supports it, otherwise remove it
|
|
||||||
perl "$GENHTML" \
|
|
||||||
"${LCOV_INFO}" \
|
|
||||||
--output-directory "$HTML_DIR" \
|
|
||||||
--title "OMath Coverage Report" \
|
|
||||||
--legend \
|
|
||||||
--show-details \
|
|
||||||
--branch-coverage \
|
|
||||||
--ignore-errors source
|
|
||||||
|
|
||||||
echo "✅ LCOV HTML report generated at $HTML_DIR"
|
|
||||||
|
|
||||||
- name: Upload Coverage (HTML Report)
|
- name: Upload Coverage (HTML Report)
|
||||||
if: ${{ matrix.triplet == 'x64-windows' }}
|
if: ${{ matrix.triplet == 'x64-windows' }}
|
||||||
|
|||||||
+20
-10
@@ -2,11 +2,9 @@
|
|||||||
// Created by Vlad on 9/17/2025.
|
// Created by Vlad on 9/17/2025.
|
||||||
//
|
//
|
||||||
#include <benchmark/benchmark.h>
|
#include <benchmark/benchmark.h>
|
||||||
|
|
||||||
#include <omath/omath.hpp>
|
#include <omath/omath.hpp>
|
||||||
using namespace omath;
|
using namespace omath;
|
||||||
|
|
||||||
|
|
||||||
void mat_float_multiplication_col_major(benchmark::State& state)
|
void mat_float_multiplication_col_major(benchmark::State& state)
|
||||||
{
|
{
|
||||||
using MatType = Mat<128, 128, float, MatStoreType::COLUMN_MAJOR>;
|
using MatType = Mat<128, 128, float, MatStoreType::COLUMN_MAJOR>;
|
||||||
@@ -15,9 +13,12 @@ void mat_float_multiplication_col_major(benchmark::State& state)
|
|||||||
a.set(3.f);
|
a.set(3.f);
|
||||||
b.set(7.f);
|
b.set(7.f);
|
||||||
|
|
||||||
|
|
||||||
for ([[maybe_unused]] const auto _ : state)
|
for ([[maybe_unused]] const auto _ : state)
|
||||||
std::ignore = a * b;
|
{
|
||||||
|
benchmark::DoNotOptimize(a);
|
||||||
|
benchmark::DoNotOptimize(b);
|
||||||
|
benchmark::DoNotOptimize(a * b);
|
||||||
|
}
|
||||||
}
|
}
|
||||||
void mat_float_multiplication_row_major(benchmark::State& state)
|
void mat_float_multiplication_row_major(benchmark::State& state)
|
||||||
{
|
{
|
||||||
@@ -27,9 +28,12 @@ void mat_float_multiplication_row_major(benchmark::State& state)
|
|||||||
a.set(3.f);
|
a.set(3.f);
|
||||||
b.set(7.f);
|
b.set(7.f);
|
||||||
|
|
||||||
|
|
||||||
for ([[maybe_unused]] const auto _ : state)
|
for ([[maybe_unused]] const auto _ : state)
|
||||||
std::ignore = a * b;
|
{
|
||||||
|
benchmark::DoNotOptimize(a);
|
||||||
|
benchmark::DoNotOptimize(b);
|
||||||
|
benchmark::DoNotOptimize(a * b);
|
||||||
|
}
|
||||||
}
|
}
|
||||||
|
|
||||||
void mat_double_multiplication_row_major(benchmark::State& state)
|
void mat_double_multiplication_row_major(benchmark::State& state)
|
||||||
@@ -40,9 +44,12 @@ void mat_double_multiplication_row_major(benchmark::State& state)
|
|||||||
a.set(3.f);
|
a.set(3.f);
|
||||||
b.set(7.f);
|
b.set(7.f);
|
||||||
|
|
||||||
|
|
||||||
for ([[maybe_unused]] const auto _ : state)
|
for ([[maybe_unused]] const auto _ : state)
|
||||||
std::ignore = a * b;
|
{
|
||||||
|
benchmark::DoNotOptimize(a);
|
||||||
|
benchmark::DoNotOptimize(b);
|
||||||
|
benchmark::DoNotOptimize(a * b);
|
||||||
|
}
|
||||||
}
|
}
|
||||||
|
|
||||||
void mat_double_multiplication_col_major(benchmark::State& state)
|
void mat_double_multiplication_col_major(benchmark::State& state)
|
||||||
@@ -53,9 +60,12 @@ void mat_double_multiplication_col_major(benchmark::State& state)
|
|||||||
a.set(3.f);
|
a.set(3.f);
|
||||||
b.set(7.f);
|
b.set(7.f);
|
||||||
|
|
||||||
|
|
||||||
for ([[maybe_unused]] const auto _ : state)
|
for ([[maybe_unused]] const auto _ : state)
|
||||||
std::ignore = a * b;
|
{
|
||||||
|
benchmark::DoNotOptimize(a);
|
||||||
|
benchmark::DoNotOptimize(b);
|
||||||
|
benchmark::DoNotOptimize(a * b);
|
||||||
|
}
|
||||||
}
|
}
|
||||||
|
|
||||||
BENCHMARK(mat_float_multiplication_col_major)->Iterations(5000);
|
BENCHMARK(mat_float_multiplication_col_major)->Iterations(5000);
|
||||||
|
|||||||
@@ -6,6 +6,17 @@ if (@OMATH_IMGUI_INTEGRATION@)
|
|||||||
find_dependency(imgui CONFIG)
|
find_dependency(imgui CONFIG)
|
||||||
endif()
|
endif()
|
||||||
|
|
||||||
|
if (@OMATH_ENABLE_LUA@)
|
||||||
|
find_dependency(Lua)
|
||||||
|
endif()
|
||||||
|
|
||||||
|
if (@OMATH_ENABLE_HOOKING@)
|
||||||
|
find_dependency(safetyhook CONFIG)
|
||||||
|
if (NOT WIN32 AND (UNIX AND NOT APPLE))
|
||||||
|
find_dependency(OpenGL)
|
||||||
|
endif()
|
||||||
|
endif()
|
||||||
|
|
||||||
# Load the targets for the omath library
|
# Load the targets for the omath library
|
||||||
include("${CMAKE_CURRENT_LIST_DIR}/omathTargets.cmake")
|
include("${CMAKE_CURRENT_LIST_DIR}/omathTargets.cmake")
|
||||||
check_required_components(omath)
|
check_required_components(omath)
|
||||||
|
|||||||
@@ -161,6 +161,12 @@ namespace imgui_desktop::gui
|
|||||||
ImGuiColorEditFlags_NoInputs);
|
ImGuiColorEditFlags_NoInputs);
|
||||||
ImGui::ColorEdit4("Gradient right##lbl", reinterpret_cast<float*>(&m_label_gradient_right),
|
ImGui::ColorEdit4("Gradient right##lbl", reinterpret_cast<float*>(&m_label_gradient_right),
|
||||||
ImGuiColorEditFlags_NoInputs);
|
ImGuiColorEditFlags_NoInputs);
|
||||||
|
if (m_animate_gradients)
|
||||||
|
{
|
||||||
|
int direction = static_cast<int>(m_label_gradient_direction);
|
||||||
|
if (ImGui::Combo("Direction##lbl", &direction, "Right to left\0Left to right\0"))
|
||||||
|
m_label_gradient_direction = static_cast<omath::hud::GradientDirection>(direction);
|
||||||
|
}
|
||||||
}
|
}
|
||||||
ImGui::SliderFloat("Offset##lbl", &m_label_offset, 0.f, 15.f);
|
ImGui::SliderFloat("Offset##lbl", &m_label_offset, 0.f, 15.f);
|
||||||
ImGui::Checkbox("Right##lbl", &m_show_right_labels);
|
ImGui::Checkbox("Right##lbl", &m_show_right_labels);
|
||||||
@@ -309,7 +315,8 @@ namespace imgui_desktop::gui
|
|||||||
const Paint centered_label_color =
|
const Paint centered_label_color =
|
||||||
m_gradient_label ? Paint{omath::hud::Gradient{m_label_gradient_left, m_label_gradient_right,
|
m_gradient_label ? Paint{omath::hud::Gradient{m_label_gradient_left, m_label_gradient_right,
|
||||||
m_label_gradient_right, m_label_gradient_left,
|
m_label_gradient_right, m_label_gradient_left,
|
||||||
m_animate_gradients}}
|
m_animate_gradients, 4.f, 0.7f,
|
||||||
|
m_label_gradient_direction}}
|
||||||
: Paint{omath::Color::from_rgba(255, 255, 255, 255)};
|
: Paint{omath::Color::from_rgba(255, 255, 255, 255)};
|
||||||
|
|
||||||
auto outline_helper = [](const bool is_outline) -> Outlined
|
auto outline_helper = [](const bool is_outline) -> Outlined
|
||||||
|
|||||||
@@ -68,6 +68,7 @@ namespace imgui_desktop::gui
|
|||||||
omath::Color m_label_gradient_right{1.f, 0.2f, 0.7f, 1.f};
|
omath::Color m_label_gradient_right{1.f, 0.2f, 0.7f, 1.f};
|
||||||
bool m_outlined = true;
|
bool m_outlined = true;
|
||||||
bool m_gradient_label = true;
|
bool m_gradient_label = true;
|
||||||
|
omath::hud::GradientDirection m_label_gradient_direction = omath::hud::GradientDirection::RightToLeft;
|
||||||
bool m_show_right_labels = true, m_show_left_labels = true;
|
bool m_show_right_labels = true, m_show_left_labels = true;
|
||||||
bool m_show_top_labels = true, m_show_bottom_labels = true;
|
bool m_show_top_labels = true, m_show_bottom_labels = true;
|
||||||
bool m_show_centered_top = true, m_show_centered_bottom = true;
|
bool m_show_centered_top = true, m_show_centered_bottom = true;
|
||||||
|
|||||||
@@ -3,6 +3,12 @@
|
|||||||
|
|
||||||
namespace omath::hud
|
namespace omath::hud
|
||||||
{
|
{
|
||||||
|
enum class GradientDirection
|
||||||
|
{
|
||||||
|
RightToLeft,
|
||||||
|
LeftToRight,
|
||||||
|
};
|
||||||
|
|
||||||
struct Gradient
|
struct Gradient
|
||||||
{
|
{
|
||||||
Color top_left;
|
Color top_left;
|
||||||
@@ -12,5 +18,6 @@ namespace omath::hud
|
|||||||
bool animated = false;
|
bool animated = false;
|
||||||
float animation_speed = 4.f;
|
float animation_speed = 4.f;
|
||||||
float animation_spread = 0.7f;
|
float animation_spread = 0.7f;
|
||||||
|
GradientDirection direction = GradientDirection::RightToLeft;
|
||||||
};
|
};
|
||||||
} // namespace omath::hud
|
} // namespace omath::hud
|
||||||
|
|||||||
@@ -186,7 +186,14 @@ namespace omath
|
|||||||
else if constexpr (StoreType == MatStoreType::COLUMN_MAJOR)
|
else if constexpr (StoreType == MatStoreType::COLUMN_MAJOR)
|
||||||
return cache_friendly_multiply_col_major(other);
|
return cache_friendly_multiply_col_major(other);
|
||||||
}
|
}
|
||||||
if constexpr (StoreType == MatStoreType::ROW_MAJOR)
|
if constexpr (!std::is_same_v<Type, float> && !std::is_same_v<Type, double>)
|
||||||
|
{
|
||||||
|
if constexpr (StoreType == MatStoreType::ROW_MAJOR)
|
||||||
|
return cache_friendly_multiply_row_major(other);
|
||||||
|
else if constexpr (StoreType == MatStoreType::COLUMN_MAJOR)
|
||||||
|
return cache_friendly_multiply_col_major(other);
|
||||||
|
}
|
||||||
|
else if constexpr (StoreType == MatStoreType::ROW_MAJOR)
|
||||||
return avx_multiply_row_major(other);
|
return avx_multiply_row_major(other);
|
||||||
else if constexpr (StoreType == MatStoreType::COLUMN_MAJOR)
|
else if constexpr (StoreType == MatStoreType::COLUMN_MAJOR)
|
||||||
return avx_multiply_col_major(other);
|
return avx_multiply_col_major(other);
|
||||||
@@ -429,13 +436,22 @@ namespace omath
|
|||||||
cache_friendly_multiply_row_major(const Mat<Columns, OtherColumns, Type, MatStoreType::ROW_MAJOR>& other) const
|
cache_friendly_multiply_row_major(const Mat<Columns, OtherColumns, Type, MatStoreType::ROW_MAJOR>& other) const
|
||||||
{
|
{
|
||||||
Mat<Rows, OtherColumns, Type, MatStoreType::ROW_MAJOR> result;
|
Mat<Rows, OtherColumns, Type, MatStoreType::ROW_MAJOR> result;
|
||||||
|
const Type* left_data = m_data.data();
|
||||||
|
const Type* right_data = other.raw_array().data();
|
||||||
|
Type* result_data = result.raw_array().data();
|
||||||
|
|
||||||
for (std::size_t row_index = 0; row_index < Rows; ++row_index)
|
for (std::size_t row_index = 0; row_index < Rows; ++row_index)
|
||||||
|
{
|
||||||
|
const Type* left_row = left_data + row_index * Columns;
|
||||||
|
Type* result_row = result_data + row_index * OtherColumns;
|
||||||
for (std::size_t column_index = 0; column_index < Columns; ++column_index)
|
for (std::size_t column_index = 0; column_index < Columns; ++column_index)
|
||||||
{
|
{
|
||||||
const Type& current_number = at(row_index, column_index);
|
const Type current_number = left_row[column_index];
|
||||||
|
const Type* right_row = right_data + column_index * OtherColumns;
|
||||||
for (std::size_t other_column = 0; other_column < OtherColumns; ++other_column)
|
for (std::size_t other_column = 0; other_column < OtherColumns; ++other_column)
|
||||||
result.at(row_index, other_column) += current_number * other.at(column_index, other_column);
|
result_row[other_column] += current_number * right_row[other_column];
|
||||||
}
|
}
|
||||||
|
}
|
||||||
return result;
|
return result;
|
||||||
}
|
}
|
||||||
|
|
||||||
@@ -444,13 +460,22 @@ namespace omath
|
|||||||
const Mat<Columns, OtherColumns, Type, MatStoreType::COLUMN_MAJOR>& other) const
|
const Mat<Columns, OtherColumns, Type, MatStoreType::COLUMN_MAJOR>& other) const
|
||||||
{
|
{
|
||||||
Mat<Rows, OtherColumns, Type, MatStoreType::COLUMN_MAJOR> result;
|
Mat<Rows, OtherColumns, Type, MatStoreType::COLUMN_MAJOR> result;
|
||||||
|
const Type* left_data = m_data.data();
|
||||||
|
const Type* right_data = other.raw_array().data();
|
||||||
|
Type* result_data = result.raw_array().data();
|
||||||
|
|
||||||
for (std::size_t other_column = 0; other_column < OtherColumns; ++other_column)
|
for (std::size_t other_column = 0; other_column < OtherColumns; ++other_column)
|
||||||
|
{
|
||||||
|
const Type* right_column = right_data + other_column * Columns;
|
||||||
|
Type* result_column = result_data + other_column * Rows;
|
||||||
for (std::size_t column_index = 0; column_index < Columns; ++column_index)
|
for (std::size_t column_index = 0; column_index < Columns; ++column_index)
|
||||||
{
|
{
|
||||||
const Type& current_number = other.at(column_index, other_column);
|
const Type current_number = right_column[column_index];
|
||||||
|
const Type* left_column = left_data + column_index * Rows;
|
||||||
for (std::size_t row_index = 0; row_index < Rows; ++row_index)
|
for (std::size_t row_index = 0; row_index < Rows; ++row_index)
|
||||||
result.at(row_index, other_column) += at(row_index, column_index) * current_number;
|
result_column[row_index] += left_column[row_index] * current_number;
|
||||||
}
|
}
|
||||||
|
}
|
||||||
return result;
|
return result;
|
||||||
}
|
}
|
||||||
#ifdef OMATH_USE_AVX2
|
#ifdef OMATH_USE_AVX2
|
||||||
@@ -466,56 +491,92 @@ namespace omath
|
|||||||
|
|
||||||
if constexpr (std::is_same_v<Type, float>)
|
if constexpr (std::is_same_v<Type, float>)
|
||||||
{
|
{
|
||||||
// ReSharper disable once CppTooWideScopeInitStatement
|
|
||||||
constexpr std::size_t vector_size = 8;
|
constexpr std::size_t vector_size = 8;
|
||||||
|
constexpr std::size_t block_size = vector_size * 4;
|
||||||
for (std::size_t j = 0; j < OtherColumns; ++j)
|
for (std::size_t j = 0; j < OtherColumns; ++j)
|
||||||
{
|
{
|
||||||
auto* c_col = reinterpret_cast<float*>(result_mat_data + j * Rows);
|
auto* c_col = reinterpret_cast<float*>(result_mat_data + j * Rows);
|
||||||
for (std::size_t k = 0; k < Columns; ++k)
|
std::size_t i = 0;
|
||||||
|
for (; i + block_size <= Rows; i += block_size)
|
||||||
{
|
{
|
||||||
const float bkj = reinterpret_cast<const float*>(other_mat_data)[k + j * Columns];
|
__m256 cvec0 = _mm256_setzero_ps();
|
||||||
const __m256 bkj_vec = _mm256_set1_ps(bkj);
|
__m256 cvec1 = _mm256_setzero_ps();
|
||||||
|
__m256 cvec2 = _mm256_setzero_ps();
|
||||||
const auto* a_col_k = reinterpret_cast<const float*>(this_mat_data + k * Rows);
|
__m256 cvec3 = _mm256_setzero_ps();
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
std::size_t i = 0;
|
|
||||||
for (; i + vector_size <= Rows; i += vector_size)
|
|
||||||
{
|
{
|
||||||
__m256 cvec = _mm256_loadu_ps(c_col + i);
|
const __m256 bkj_vec = _mm256_set1_ps(other_mat_data[k + j * Columns]);
|
||||||
|
const auto* a_col_k = this_mat_data + k * Rows + i;
|
||||||
|
cvec0 = _mm256_fmadd_ps(_mm256_loadu_ps(a_col_k), bkj_vec, cvec0);
|
||||||
|
cvec1 = _mm256_fmadd_ps(_mm256_loadu_ps(a_col_k + vector_size), bkj_vec, cvec1);
|
||||||
|
cvec2 = _mm256_fmadd_ps(_mm256_loadu_ps(a_col_k + vector_size * 2), bkj_vec, cvec2);
|
||||||
|
cvec3 = _mm256_fmadd_ps(_mm256_loadu_ps(a_col_k + vector_size * 3), bkj_vec, cvec3);
|
||||||
|
}
|
||||||
|
_mm256_storeu_ps(c_col + i, cvec0);
|
||||||
|
_mm256_storeu_ps(c_col + i + vector_size, cvec1);
|
||||||
|
_mm256_storeu_ps(c_col + i + vector_size * 2, cvec2);
|
||||||
|
_mm256_storeu_ps(c_col + i + vector_size * 3, cvec3);
|
||||||
|
}
|
||||||
|
for (; i + vector_size <= Rows; i += vector_size)
|
||||||
|
{
|
||||||
|
__m256 cvec = _mm256_setzero_ps();
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
|
{
|
||||||
|
const __m256 bkj_vec = _mm256_set1_ps(other_mat_data[k + j * Columns]);
|
||||||
|
const auto* a_col_k = this_mat_data + k * Rows;
|
||||||
const __m256 a_vec = _mm256_loadu_ps(a_col_k + i);
|
const __m256 a_vec = _mm256_loadu_ps(a_col_k + i);
|
||||||
cvec = _mm256_fmadd_ps(a_vec, bkj_vec, cvec);
|
cvec = _mm256_fmadd_ps(a_vec, bkj_vec, cvec);
|
||||||
_mm256_storeu_ps(c_col + i, cvec);
|
|
||||||
}
|
}
|
||||||
for (; i < Rows; ++i)
|
_mm256_storeu_ps(c_col + i, cvec);
|
||||||
c_col[i] += a_col_k[i] * bkj;
|
|
||||||
}
|
}
|
||||||
|
for (; i < Rows; ++i)
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
|
c_col[i] += this_mat_data[i + k * Rows] * other_mat_data[k + j * Columns];
|
||||||
}
|
}
|
||||||
}
|
}
|
||||||
else if (std::is_same_v<Type, double>)
|
else if (std::is_same_v<Type, double>)
|
||||||
{ // double
|
{
|
||||||
// ReSharper disable once CppTooWideScopeInitStatement
|
|
||||||
constexpr std::size_t vector_size = 4;
|
constexpr std::size_t vector_size = 4;
|
||||||
|
constexpr std::size_t block_size = vector_size * 4;
|
||||||
for (std::size_t j = 0; j < OtherColumns; ++j)
|
for (std::size_t j = 0; j < OtherColumns; ++j)
|
||||||
{
|
{
|
||||||
auto* c_col = reinterpret_cast<double*>(result_mat_data + j * Rows);
|
auto* c_col = reinterpret_cast<double*>(result_mat_data + j * Rows);
|
||||||
for (std::size_t k = 0; k < Columns; ++k)
|
std::size_t i = 0;
|
||||||
|
for (; i + block_size <= Rows; i += block_size)
|
||||||
{
|
{
|
||||||
const double bkj = reinterpret_cast<const double*>(other_mat_data)[k + j * Columns];
|
__m256d cvec0 = _mm256_setzero_pd();
|
||||||
const __m256d bkj_vec = _mm256_set1_pd(bkj);
|
__m256d cvec1 = _mm256_setzero_pd();
|
||||||
|
__m256d cvec2 = _mm256_setzero_pd();
|
||||||
const auto* a_col_k = reinterpret_cast<const double*>(this_mat_data + k * Rows);
|
__m256d cvec3 = _mm256_setzero_pd();
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
std::size_t i = 0;
|
|
||||||
for (; i + vector_size <= Rows; i += vector_size)
|
|
||||||
{
|
{
|
||||||
__m256d cvec = _mm256_loadu_pd(c_col + i);
|
const __m256d bkj_vec = _mm256_set1_pd(other_mat_data[k + j * Columns]);
|
||||||
|
const auto* a_col_k = this_mat_data + k * Rows + i;
|
||||||
|
cvec0 = _mm256_fmadd_pd(_mm256_loadu_pd(a_col_k), bkj_vec, cvec0);
|
||||||
|
cvec1 = _mm256_fmadd_pd(_mm256_loadu_pd(a_col_k + vector_size), bkj_vec, cvec1);
|
||||||
|
cvec2 = _mm256_fmadd_pd(_mm256_loadu_pd(a_col_k + vector_size * 2), bkj_vec, cvec2);
|
||||||
|
cvec3 = _mm256_fmadd_pd(_mm256_loadu_pd(a_col_k + vector_size * 3), bkj_vec, cvec3);
|
||||||
|
}
|
||||||
|
_mm256_storeu_pd(c_col + i, cvec0);
|
||||||
|
_mm256_storeu_pd(c_col + i + vector_size, cvec1);
|
||||||
|
_mm256_storeu_pd(c_col + i + vector_size * 2, cvec2);
|
||||||
|
_mm256_storeu_pd(c_col + i + vector_size * 3, cvec3);
|
||||||
|
}
|
||||||
|
for (; i + vector_size <= Rows; i += vector_size)
|
||||||
|
{
|
||||||
|
__m256d cvec = _mm256_setzero_pd();
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
|
{
|
||||||
|
const __m256d bkj_vec = _mm256_set1_pd(other_mat_data[k + j * Columns]);
|
||||||
|
const auto* a_col_k = this_mat_data + k * Rows;
|
||||||
const __m256d a_vec = _mm256_loadu_pd(a_col_k + i);
|
const __m256d a_vec = _mm256_loadu_pd(a_col_k + i);
|
||||||
cvec = _mm256_fmadd_pd(a_vec, bkj_vec, cvec);
|
cvec = _mm256_fmadd_pd(a_vec, bkj_vec, cvec);
|
||||||
_mm256_storeu_pd(c_col + i, cvec);
|
|
||||||
}
|
}
|
||||||
for (; i < Rows; ++i)
|
_mm256_storeu_pd(c_col + i, cvec);
|
||||||
c_col[i] += a_col_k[i] * bkj;
|
|
||||||
}
|
}
|
||||||
|
for (; i < Rows; ++i)
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
|
c_col[i] += this_mat_data[i + k * Rows] * other_mat_data[k + j * Columns];
|
||||||
}
|
}
|
||||||
}
|
}
|
||||||
else
|
else
|
||||||
@@ -536,56 +597,92 @@ namespace omath
|
|||||||
|
|
||||||
if constexpr (std::is_same_v<Type, float>)
|
if constexpr (std::is_same_v<Type, float>)
|
||||||
{
|
{
|
||||||
// ReSharper disable once CppTooWideScopeInitStatement
|
|
||||||
constexpr std::size_t vector_size = 8;
|
constexpr std::size_t vector_size = 8;
|
||||||
|
constexpr std::size_t block_size = vector_size * 4;
|
||||||
for (std::size_t i = 0; i < Rows; ++i)
|
for (std::size_t i = 0; i < Rows; ++i)
|
||||||
{
|
{
|
||||||
Type* c_row = result_mat_data + i * OtherColumns;
|
auto* c_row = reinterpret_cast<float*>(result_mat_data + i * OtherColumns);
|
||||||
for (std::size_t k = 0; k < Columns; ++k)
|
std::size_t j = 0;
|
||||||
|
for (; j + block_size <= OtherColumns; j += block_size)
|
||||||
{
|
{
|
||||||
const auto aik = static_cast<float>(this_mat_data[i * Columns + k]);
|
__m256 cvec0 = _mm256_setzero_ps();
|
||||||
const __m256 aik_vec = _mm256_set1_ps(aik);
|
__m256 cvec1 = _mm256_setzero_ps();
|
||||||
const auto* b_row = reinterpret_cast<const float*>(other_mat_data + k * OtherColumns);
|
__m256 cvec2 = _mm256_setzero_ps();
|
||||||
|
__m256 cvec3 = _mm256_setzero_ps();
|
||||||
std::size_t j = 0;
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
for (; j + vector_size <= OtherColumns; j += vector_size)
|
|
||||||
{
|
{
|
||||||
__m256 cvec = _mm256_loadu_ps(c_row + j);
|
const __m256 aik_vec = _mm256_set1_ps(this_mat_data[i * Columns + k]);
|
||||||
|
const auto* b_row = other_mat_data + k * OtherColumns + j;
|
||||||
|
cvec0 = _mm256_fmadd_ps(_mm256_loadu_ps(b_row), aik_vec, cvec0);
|
||||||
|
cvec1 = _mm256_fmadd_ps(_mm256_loadu_ps(b_row + vector_size), aik_vec, cvec1);
|
||||||
|
cvec2 = _mm256_fmadd_ps(_mm256_loadu_ps(b_row + vector_size * 2), aik_vec, cvec2);
|
||||||
|
cvec3 = _mm256_fmadd_ps(_mm256_loadu_ps(b_row + vector_size * 3), aik_vec, cvec3);
|
||||||
|
}
|
||||||
|
_mm256_storeu_ps(c_row + j, cvec0);
|
||||||
|
_mm256_storeu_ps(c_row + j + vector_size, cvec1);
|
||||||
|
_mm256_storeu_ps(c_row + j + vector_size * 2, cvec2);
|
||||||
|
_mm256_storeu_ps(c_row + j + vector_size * 3, cvec3);
|
||||||
|
}
|
||||||
|
for (; j + vector_size <= OtherColumns; j += vector_size)
|
||||||
|
{
|
||||||
|
__m256 cvec = _mm256_setzero_ps();
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
|
{
|
||||||
|
const __m256 aik_vec = _mm256_set1_ps(this_mat_data[i * Columns + k]);
|
||||||
|
const auto* b_row = other_mat_data + k * OtherColumns;
|
||||||
const __m256 b_vec = _mm256_loadu_ps(b_row + j);
|
const __m256 b_vec = _mm256_loadu_ps(b_row + j);
|
||||||
cvec = _mm256_fmadd_ps(b_vec, aik_vec, cvec);
|
cvec = _mm256_fmadd_ps(b_vec, aik_vec, cvec);
|
||||||
|
|
||||||
_mm256_storeu_ps(c_row + j, cvec);
|
|
||||||
}
|
}
|
||||||
for (; j < OtherColumns; ++j)
|
_mm256_storeu_ps(c_row + j, cvec);
|
||||||
c_row[j] += aik * b_row[j];
|
|
||||||
}
|
}
|
||||||
|
for (; j < OtherColumns; ++j)
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
|
c_row[j] += this_mat_data[i * Columns + k] * other_mat_data[k * OtherColumns + j];
|
||||||
}
|
}
|
||||||
}
|
}
|
||||||
else if (std::is_same_v<Type, double>)
|
else if (std::is_same_v<Type, double>)
|
||||||
{ // double
|
{
|
||||||
// ReSharper disable once CppTooWideScopeInitStatement
|
|
||||||
constexpr std::size_t vector_size = 4;
|
constexpr std::size_t vector_size = 4;
|
||||||
|
constexpr std::size_t block_size = vector_size * 4;
|
||||||
for (std::size_t i = 0; i < Rows; ++i)
|
for (std::size_t i = 0; i < Rows; ++i)
|
||||||
{
|
{
|
||||||
Type* c_row = result_mat_data + i * OtherColumns;
|
auto* c_row = reinterpret_cast<double*>(result_mat_data + i * OtherColumns);
|
||||||
for (std::size_t k = 0; k < Columns; ++k)
|
std::size_t j = 0;
|
||||||
|
for (; j + block_size <= OtherColumns; j += block_size)
|
||||||
{
|
{
|
||||||
const auto aik = static_cast<double>(this_mat_data[i * Columns + k]);
|
__m256d cvec0 = _mm256_setzero_pd();
|
||||||
const __m256d aik_vec = _mm256_set1_pd(aik);
|
__m256d cvec1 = _mm256_setzero_pd();
|
||||||
const auto* b_row = reinterpret_cast<const double*>(other_mat_data + k * OtherColumns);
|
__m256d cvec2 = _mm256_setzero_pd();
|
||||||
|
__m256d cvec3 = _mm256_setzero_pd();
|
||||||
std::size_t j = 0;
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
for (; j + vector_size <= OtherColumns; j += vector_size)
|
|
||||||
{
|
{
|
||||||
__m256d cvec = _mm256_loadu_pd(c_row + j);
|
const __m256d aik_vec = _mm256_set1_pd(this_mat_data[i * Columns + k]);
|
||||||
|
const auto* b_row = other_mat_data + k * OtherColumns + j;
|
||||||
|
cvec0 = _mm256_fmadd_pd(_mm256_loadu_pd(b_row), aik_vec, cvec0);
|
||||||
|
cvec1 = _mm256_fmadd_pd(_mm256_loadu_pd(b_row + vector_size), aik_vec, cvec1);
|
||||||
|
cvec2 = _mm256_fmadd_pd(_mm256_loadu_pd(b_row + vector_size * 2), aik_vec, cvec2);
|
||||||
|
cvec3 = _mm256_fmadd_pd(_mm256_loadu_pd(b_row + vector_size * 3), aik_vec, cvec3);
|
||||||
|
}
|
||||||
|
_mm256_storeu_pd(c_row + j, cvec0);
|
||||||
|
_mm256_storeu_pd(c_row + j + vector_size, cvec1);
|
||||||
|
_mm256_storeu_pd(c_row + j + vector_size * 2, cvec2);
|
||||||
|
_mm256_storeu_pd(c_row + j + vector_size * 3, cvec3);
|
||||||
|
}
|
||||||
|
for (; j + vector_size <= OtherColumns; j += vector_size)
|
||||||
|
{
|
||||||
|
__m256d cvec = _mm256_setzero_pd();
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
|
{
|
||||||
|
const __m256d aik_vec = _mm256_set1_pd(this_mat_data[i * Columns + k]);
|
||||||
|
const auto* b_row = other_mat_data + k * OtherColumns;
|
||||||
const __m256d b_vec = _mm256_loadu_pd(b_row + j);
|
const __m256d b_vec = _mm256_loadu_pd(b_row + j);
|
||||||
cvec = _mm256_fmadd_pd(b_vec, aik_vec, cvec);
|
cvec = _mm256_fmadd_pd(b_vec, aik_vec, cvec);
|
||||||
|
|
||||||
_mm256_storeu_pd(c_row + j, cvec);
|
|
||||||
}
|
}
|
||||||
for (; j < OtherColumns; ++j)
|
_mm256_storeu_pd(c_row + j, cvec);
|
||||||
c_row[j] += aik * b_row[j];
|
|
||||||
}
|
}
|
||||||
|
for (; j < OtherColumns; ++j)
|
||||||
|
for (std::size_t k = 0; k < Columns; ++k)
|
||||||
|
c_row[j] += this_mat_data[i * Columns + k] * other_mat_data[k * OtherColumns + j];
|
||||||
}
|
}
|
||||||
}
|
}
|
||||||
else
|
else
|
||||||
|
|||||||
@@ -54,9 +54,6 @@ namespace omath
|
|||||||
return {value, Length - 1};
|
return {value, Length - 1};
|
||||||
}
|
}
|
||||||
};
|
};
|
||||||
template<std::size_t N>
|
|
||||||
ConstevalPattern(const char (&)[N]) -> ConstevalPattern<N>;
|
|
||||||
|
|
||||||
[[nodiscard]]
|
[[nodiscard]]
|
||||||
static std::span<std::byte>::iterator scan_for_pattern(const std::span<std::byte>& range,
|
static std::span<std::byte>::iterator scan_for_pattern(const std::span<std::byte>& range,
|
||||||
const std::string_view& pattern);
|
const std::string_view& pattern);
|
||||||
|
|||||||
@@ -103,6 +103,7 @@ namespace omath::hud
|
|||||||
if (gradient.animated)
|
if (gradient.animated)
|
||||||
{
|
{
|
||||||
const float animation_offset = static_cast<float>(ImGui::GetTime()) * gradient.animation_speed;
|
const float animation_offset = static_cast<float>(ImGui::GetTime()) * gradient.animation_speed;
|
||||||
|
const float direction = gradient.direction == GradientDirection::RightToLeft ? 1.f : -1.f;
|
||||||
float cursor_x = position.x;
|
float cursor_x = position.x;
|
||||||
const char* glyph_start = text.data();
|
const char* glyph_start = text.data();
|
||||||
const char* const text_end = text.data() + text.size();
|
const char* const text_end = text.data() + text.size();
|
||||||
@@ -117,7 +118,9 @@ namespace omath::hud
|
|||||||
|
|
||||||
const char* const glyph_end = glyph_start + glyph_size;
|
const char* const glyph_end = glyph_start + glyph_size;
|
||||||
const float blend =
|
const float blend =
|
||||||
(std::sin(animation_offset + static_cast<float>(glyph_index) * gradient.animation_spread) + 1.f)
|
(std::sin(animation_offset + direction * static_cast<float>(glyph_index)
|
||||||
|
* gradient.animation_spread)
|
||||||
|
+ 1.f)
|
||||||
* 0.5f;
|
* 0.5f;
|
||||||
const auto color = gradient.top_left.value() * (1.f - blend) + gradient.top_right.value() * blend;
|
const auto color = gradient.top_left.value() * (1.f - blend) + gradient.top_right.value() * blend;
|
||||||
draw_list->AddText({cursor_x, position.y}, Color{color}.to_im_color(), glyph_start, glyph_end);
|
draw_list->AddText({cursor_x, position.y}, Color{color}.to_im_color(), glyph_start, glyph_end);
|
||||||
|
|||||||
@@ -16,6 +16,21 @@ namespace
|
|||||||
const float diff = actual - expected;
|
const float diff = actual - expected;
|
||||||
return (diff < 0.0f ? -diff : diff) <= epsilon;
|
return (diff < 0.0f ? -diff : diff) <= epsilon;
|
||||||
}
|
}
|
||||||
|
|
||||||
|
template<size_t Rows, size_t Columns, size_t OtherColumns, class Type, MatStoreType StoreType>
|
||||||
|
void expect_multiplication_matches_scalar_reference(const Mat<Rows, Columns, Type, StoreType>& left,
|
||||||
|
const Mat<Columns, OtherColumns, Type, StoreType>& right)
|
||||||
|
{
|
||||||
|
const auto result = left * right;
|
||||||
|
for (size_t row = 0; row < Rows; ++row)
|
||||||
|
for (size_t column = 0; column < OtherColumns; ++column)
|
||||||
|
{
|
||||||
|
Type expected{};
|
||||||
|
for (size_t shared_index = 0; shared_index < Columns; ++shared_index)
|
||||||
|
expected += left.at(row, shared_index) * right.at(shared_index, column);
|
||||||
|
EXPECT_EQ(result.at(row, column), expected);
|
||||||
|
}
|
||||||
|
}
|
||||||
} // namespace
|
} // namespace
|
||||||
|
|
||||||
class UnitTestMat : public ::testing::Test
|
class UnitTestMat : public ::testing::Test
|
||||||
@@ -92,6 +107,45 @@ TEST_F(UnitTestMat, Operator_Multiplication_Matrix)
|
|||||||
EXPECT_FLOAT_EQ(m3.at(1, 1), 22.0f);
|
EXPECT_FLOAT_EQ(m3.at(1, 1), 22.0f);
|
||||||
}
|
}
|
||||||
|
|
||||||
|
TEST(UnitTestMatStandalone, Operator_Multiplication_RowMajorSimdAndTail)
|
||||||
|
{
|
||||||
|
Mat<3, 5, float, MatStoreType::ROW_MAJOR> left;
|
||||||
|
Mat<5, 33, float, MatStoreType::ROW_MAJOR> right;
|
||||||
|
for (size_t row = 0; row < left.row_count(); ++row)
|
||||||
|
for (size_t column = 0; column < left.columns_count(); ++column)
|
||||||
|
left.at(row, column) = static_cast<float>(row * 3 + column + 1);
|
||||||
|
for (size_t row = 0; row < right.row_count(); ++row)
|
||||||
|
for (size_t column = 0; column < right.columns_count(); ++column)
|
||||||
|
right.at(row, column) = static_cast<float>((row + 1) * (column % 5 + 1));
|
||||||
|
|
||||||
|
expect_multiplication_matches_scalar_reference(left, right);
|
||||||
|
}
|
||||||
|
|
||||||
|
TEST(UnitTestMatStandalone, Operator_Multiplication_ColumnMajorSimdAndTail)
|
||||||
|
{
|
||||||
|
Mat<17, 5, double, MatStoreType::COLUMN_MAJOR> left;
|
||||||
|
Mat<5, 3, double, MatStoreType::COLUMN_MAJOR> right;
|
||||||
|
for (size_t row = 0; row < left.row_count(); ++row)
|
||||||
|
for (size_t column = 0; column < left.columns_count(); ++column)
|
||||||
|
left.at(row, column) = static_cast<double>(row * 3 + column + 1);
|
||||||
|
for (size_t row = 0; row < right.row_count(); ++row)
|
||||||
|
for (size_t column = 0; column < right.columns_count(); ++column)
|
||||||
|
right.at(row, column) = static_cast<double>((row + 1) * (column + 1));
|
||||||
|
|
||||||
|
expect_multiplication_matches_scalar_reference(left, right);
|
||||||
|
}
|
||||||
|
|
||||||
|
TEST(UnitTestMatStandalone, Operator_Multiplication_IntegerFallsBackFromAvx)
|
||||||
|
{
|
||||||
|
constexpr Mat<2, 3, int> left{{1, 2, 3}, {4, 5, 6}};
|
||||||
|
constexpr Mat<3, 2, int> right{{7, 8}, {9, 10}, {11, 12}};
|
||||||
|
constexpr auto result = left * right;
|
||||||
|
static_assert(result.at(0, 0) == 58);
|
||||||
|
static_assert(result.at(1, 1) == 154);
|
||||||
|
|
||||||
|
expect_multiplication_matches_scalar_reference(left, right);
|
||||||
|
}
|
||||||
|
|
||||||
TEST_F(UnitTestMat, Operator_Multiplication_Scalar)
|
TEST_F(UnitTestMat, Operator_Multiplication_Scalar)
|
||||||
{
|
{
|
||||||
Mat<2, 2> m3 = m2 * 2.0f;
|
Mat<2, 2> m3 = m2 * 2.0f;
|
||||||
|
|||||||
Reference in New Issue
Block a user